CAG:缓存增强生成,RAG的替代方案 ✍ Amto🕐 2026-07-29📦 2.0 KB 🟢 已读 𝕏 文章列表 文章介绍了缓存增强生成(CAG)作为一种替代经典RAG流水线的新方案。CAG通过将全部知识预加载到模型上下文并缓存KV Cache,显著提升响应速度,解决检索延迟和召回缺失问题。适用于中短篇幅静态文档,但对大规模或频繁变动数据仍需传统RAG或混合架构。 CAGRAG缓存增强生成LLM私有知识向量化KV Cache开源 # 你是不是也为了给AI接入私有知识而搭过那套经典RAG流水线 > 采集时间: 2026-07-29 11:50:23 > 作者: Amto (@XAMTO_AI) > 来源: https://x.com/XAMTO_AI/status/2082013941975154937 > 共 1 条帖子 --- ## 2026-07-28 16:03:00 你是不是也为了给AI接入私有知识,而搭过那套经典RAG流水线? 分块、向量化、存数据库、检索、拼Prompt,每个环节都在消耗耐心。结果呢?每次问答都伴随着检索延迟、召回缺失的风险,维护起来更是身心俱疲,代码越改越臃肿。 然而,风向变了。当大模型上下文窗口动辄以百万token计,CAG(缓存增强生成)这条路子开始展露头角。它不再追求“实时检索”,而是大胆地将全部知识在应用启动时就塞进模型上下文,并直接缓存住关键的KV Cache。用户提问的瞬间,推理直接命中缓存,向量库和检索步骤?不存在的。 效率的飞跃是实实在在的。论文实测显示,由于绕过了Embed与向量搜索,响应速度的提升肉眼可见。更重要的是,CAG从根源上掐断了RAG最致命的痛点,“第一步检索没查到,后面全在瞎编”。全量知识常驻上下文,分块带来的语义断裂和召回缺陷自然也就烟消云散。 看看hhhuang/CAG这套开源实现(ACM Web Conference 2025论文代码),你就知道什么叫极简。代码库异常清爽,向量数据库和复杂管线统统消失,维护成本直线下降。 💡 那么,谁最适合立刻上手这套方案?如果你的知识库是中短篇幅的静态文档,比如产品FAQ、代码库说明或合规手册,CAG可以说是绝配。但若你面对的是几百GB甚至TB级的庞大数据,或数据本身在秒级频繁变动,那还是冷静一下,传统的RAG,或者CAG+RAG的混合架构,才是更理性的选择。 🔗不妨亲自体验:[github.com/hhhuang/CAG](https://github.com/hhhuang/CAG)  ---
深 深入理解 AI Agent:设计原理与工程实践 李博杰新书《深入理解 AI Agent:设计原理与工程实践》开源,涵盖从0到1构建生产级AI Agent的原理与代码,包括RAG、工具调用、多Agent协作等实战内容。 技术 › Agent ✍ 李博杰🕐 2026-07-15 AI Agent开源LLMRAG工具调用多模态编程工程实践生产级代码
阿 阿里开源 Zvec:像 SQLite 一样极简的嵌入式向量数据库 阿里开源了一款名为 Zvec 的向量数据库项目,主打“纯本地、内嵌式”极简体验,号称向量界的 SQLite。该项目基于 C++ 编写,支持零配置安装,性能强悍(毫秒级搜索数十亿向量),同时兼容稠密、稀疏向量及全文检索。它非常适合本地大模型、RAG 和个人知识库开发,彻底免去了部署繁琐的后端向量服务。 技术 › 后端 ✍ 智享🕐 2026-07-08 向量数据库阿里ZvecRAG本地大模型开源LLMAgent数据库工具
R RAG 行业要被干翻了 作者介绍了 PageIndex 这一 RAG 领域的革命性工具,号称无需向量数据库和嵌入,通过树形索引实现 98.7% 的准确率,并分享了 GitHub 项目发现助手 Ossium。 技术 › LLM ✍ 币世王 | TermMax (@0xKingsKuan)🕐 2026-05-06 RAGPageIndex开源LLMAI工具
A AI代理内存痛点终于被解决?GBrain + Hermes/OpenClaw真实反馈 作者分享了AI代理工具Hermes和OpenClaw在长期记忆方面的痛点,并介绍了YC总裁Garry Tan开源的GBrain。GBrain作为一个“外挂大脑”,基于Postgres和向量技术,解决了AI代理容易遗忘的问题,实现了跨会话的长期记忆和知识库管理,被视为2026年个人AI生产力的重要突破。 技术 › Agent ✍ loveabit🕐 2026-05-03 AI代理GBrainHermesOpenClawLLM知识管理开源生产力长期记忆RAG
I Introducing SMFS: The Supermemory Filesystem SMFS 是一个结合了 RAG 和传统文件系统优势的新型可挂载文件系统。它允许 Agent 使用标准的 Unix 命令(如 grep)执行语义搜索,支持多格式文件的自动解析与提取,并提供本地优先的同步引擎。内部基准测试显示,SMFS 能显著减少 Token 消耗和工具调用次数,同时大幅提升检索准确率。 技术 › 工具与效率 ✍ Dhravya Shah🕐 2026-04-29 RAGAgentLLM文件系统开源语义搜索RustDevOps工具SMFS
6 69个最佳开源AI仓库推荐(2026年4月) 文章精选了69个经过实战验证、维护活跃的开源AI仓库,旨在替代昂贵的API订阅。内容涵盖完整的AI技术栈,包括本地大模型推理、RAG知识库构建、AI智能体框架、提示词与评估、模型微调、工具链及部署等十大领域,为开发者、研究人员和独立黑客提供免费的生产级AI工具清单。 技术 › 工具与效率 ✍ self.dll🕐 2026-04-29 开源AI工具LLMAgentRAG模型微调OllamaLangChain本地部署资源合集
M Meet Scout: 开源的企业级上下文代理 本文介绍了 Scout,一个开源的企业级“上下文代理”(Company Brain)。针对现有方案将所有数据存入向量数据库导致索引过时的问题,Scout 提出了“导航优于搜索”的理念,通过 Context Providers 连接 Slack、Google Drive 等实时数据源,像操作文件系统一样导航信息。它还能动态构建 Wiki 和 CRM,并通过持续学习形成闭环。 技术 › Agent ✍ Ashpreet Bedi🕐 2026-04-29 Agent开源RAG上下文提供商企业知识库SlackCRMLLM向量数据库自动化
如 如何构建深度研究系统:超越 OpenAI 的开源方案 文章介绍了如何构建一个完全开源、可本地部署的深度研究系统。该系统由 Onyx(检索层)、CrewAI(编排层)和 Voxtral(语音层)组成。通过三阶段执行流程、自适应策略和六阶段检索管道,Onyx 在 DeepResearch Bench 排名第一,超越了 OpenAI 和 Gemini。文章强调了数据隐私的重要性,并详细拆解了实现高质量自我托管研究的架构细节。 技术 › Agent ✍ Akshay🕐 2026-04-24 开源自部署RAG深度研究数据隐私CrewAIOnyx架构设计LLM语音交互
F From GPT2 to Kimi3, Explained 文章回顾了从 GPT-2 (2019) 到 KimiK3 (2026) 的大语言模型架构演进,重点对比了参数规模从 1.24 亿到 2.8 万亿的巨大跨越。深入解析了 GPT-2 的 Transformer 解码器结构、KV 缓存机制,并探讨了线性注意力机制在降低计算复杂度方面的原理与权衡。 技术 › LLM ✍ ali🕐 2026-07-28 LLMTransformerKimiK3GPT-2AttentionKV Cache架构演进线性注意力
P PagedAttention & RadixAttention 本文深入探讨了 PagedAttention 和 RadixAttention 两种技术。PagedAttention 通过类似操作系统的分页机制管理 GPU 内存,解决 KV Cache 的内部和外部碎片问题,显著提升并发处理能力。RadixAttention 则利用基数树索引缓存的前缀状态,实现跨请求的计算和内存复用,进一步优化推理性能。 技术 › LLM ✍ prasanna🕐 2026-07-28 vLLMSGLangPagedAttentionRadixAttentionKV Cache内存管理推理优化LLM
浪 浪费20亿Token之后,我做了一个帮自己定义目标的Skill 作者分享了一个名为Leader.skill的开源工具,旨在解决Agent交互中目标定义模糊的问题。该工具基于“目标七问”方法论,将模糊需求转化为清晰的目标任务书,支持多模型组合(如Claude规划、GPT执行),显著提升长程任务的完成率与Token利用率。 技术 › Skill ✍ 数字生命卡兹克🕐 2026-07-27 AgentGoal Engineering目标定义自动化开源LLM效率工具方法论ClaudeGPT
2 2026年如何成为AI工程师(无需CS学位) 文章指出2026年AI工程师角色已分化为机器学习工程师和应用AI工程师。对于非CS学位求职者,后者是主要机会。文章详细列出了必备技能(Python、LLM行为、RAG系统、评估观测),并提出了三个能替代学历证明的实战项目建议。 技术 › LLM ✍ Harman🕐 2026-07-24 AI工程师职业发展RAGLLMAgentPrompt无学位