📚 Wiki 知识库

🏷️ 向量检索

7 篇

《指挥 AI,做出一个企业级 Agent》08:企业 RAG 不是上传几个 PDF

文章指出企业 RAG 不仅仅是上传 PDF 回答问题,更需关注文档版本、权限、来源追溯及停用管理。作者通过模拟企业真实文档环境,构建了包含版本控制和过滤机制的评测体系,强调了可靠检索与诚实无答案的重要性,并分享了针对小规模知识库的技术选型经验。

技术Agent ✍ jager🕐 2026-07-22

Agent 的数据面概念扫盲-建立技术侧认知体系

本文深入解析了 Agent 数据面的核心概念,将其比作操作系统的内存管理单元。文章详细阐述了 Context Engineering 的演变、Session/Thread/Profile 的架构差异,以及 Session Memory 与 Long-term Memory 的区别。作者还重点介绍了 Hermes 中的 Memory 设计方案、SQLite FTS5 与 BM25 算法原理,以及向量检索与关键词检索在 RAG 中的混合应用,旨在为开发者建立一套完整的 Agent 数据面技术认知体系。

技术Agent ✍ MateMatt🕐 2026-07-12

私有知识库从 demo 到生产,中间差了 8 层工程

文章探讨了私有知识库项目在实际落地中遇到的挑战。许多 Demo 看起来聪明,但在生产环境中常因检索链路混乱而答非所问。作者指出单纯升级模型无济于事,根本在于构建稳固的 RAG 底座。文章详细拆解了从数据源、解析、清洗、切分、Embedding 到索引、检索、生成及评估的 8 层最小可用架构,并阐述了 Agentic RAG 如何通过决策层优化检索策略。最后提供了从 0 到 1 的搭建步骤及技术选型建议,强调权限过滤、混合检索与持续评估的重要性。

技术LLM ✍ Ando🕐 2026-07-08

私有知识库第4篇:评估集 + 增量更新,让 RAG 能长期跑下去

文章探讨了 RAG(检索增强生成)系统长期运行的两大难题:评估与更新。作者提出建立包含50个问题的“评估集”,通过 Recall、Precision 和 LLM 辅助的答案准确率来量化系统效果,避免盲目调参。同时,针对文档更新导致的全量重建成本问题,介绍了基于内容 Hash 的增量更新策略,仅处理变动文档,大幅降低资源消耗与停机时间。

技术LLM ✍ Ando🕐 2026-07-08

No .md files until Series B:为何生产级 Agent 需要真正的内存层

文章以一个垂直 Agent 创业公司因使用 Markdown 文件管理内存而导致架构崩溃的真实案例为引子,深入探讨了在构建生产级、多用户、多 Agent 系统时,简单文件存储无法解决的五大核心难题:细粒度权限控制、并发写入冲突、时态查询准确性、可追溯的自我改进机制,以及海量数据的检索效率。作者指出,虽然 MD 文件适合早期原型,但一旦系统规模扩大,开发者往往会不自觉地重新发明数据库,这实际上是倒退。

技术Agent ✍ Vasilije🕐 2026-05-21

如何提高 RAG 32x 的内存效率(附代码说明)

本文介绍了利用二进制量化技术将 RAG(检索增强生成)系统内存效率提高 32 倍的方法。作者以 Perplexity 和 Azure 为例,详细展示了如何使用 Llama Index、Milvus 向量数据库和 Groq 托管的 Kimi-K2 模型构建系统。该系统可在 30 毫秒内查询 3600 万个向量,并在 1 秒内生成响应。文章提供了从数据加载、生成二值嵌入、向量索引到检索生成的完整代码实现。

技术LLM ✍ Avi Chawla🕐 2026-04-05