如何提高 RAG 32x 的内存效率(附代码说明) ✍ Avi Chawla🕐 2026-04-05📦 5.4 KB 🟢 已读 𝕏 文章列表 本文介绍了利用二进制量化技术将 RAG(检索增强生成)系统内存效率提高 32 倍的方法。作者以 Perplexity 和 Azure 为例,详细展示了如何使用 Llama Index、Milvus 向量数据库和 Groq 托管的 Kimi-K2 模型构建系统。该系统可在 30 毫秒内查询 3600 万个向量,并在 1 秒内生成响应。文章提供了从数据加载、生成二值嵌入、向量索引到检索生成的完整代码实现。 RAG二进制量化向量检索内存优化MilvusLlamaIndexGroq工程实践代码教程 # 如何提高 RAG 32x 的内存效率(附代码说明)! **作者**: Avi Chawla **日期**: 2026-03-30T09:02:19.000Z **来源**: [https://x.com/_avichawla/status/2040326889928356122](https://x.com/_avichawla/status/2040326889928356122) ---  Perplexity、Azure、HubSpot 等众多公司如何使用二进制量化来提高 RAG 32x 的内存效率(附代码说明)! 业内常用的一种简单技术可以使 RAG 的内存效率提高约 32 倍! - Perplexity 在其搜索索引中使用它 - Azure 在其搜索管道中使用它。 - HubSpot 在其人工智能助手中使用它 为了了解这一点,我们将构建一个 RAG 系统,该系统可在 <30ms 内查询 3600 万个以上的向量。 而实现这一目标的技术被称为二进制量化。 技术栈: - 用于编排的 Llama Index(开源) - Milvus 作为向量数据库(开源) - Kimi-K2 作为 LLM 在 Groq(托管)上托管  工作流程如下:  - 摄取文档并生成二进制嵌入。 - 创建二进制向量索引并将嵌入存储在向量数据库中。 - 检索与用户查询最相似的前 k 个文档。 - LLM 根据额外的上下文生成响应。 让我们来实现这个目标! ## 1)加载数据 我们使用 LlamaIndex 的目录读取器工具导入文档。它可以读取多种数据格式,包括 Markdown、PDF、Word 文档、PowerPoint 演示文稿、图像、音频和视频。 为了便于解释,我们在这里使用了一个简单的 PDF 目录阅读器,但在实践中,您的数据摄取流程可能会从多个数据源提取数据,这些数据源具有不同的格式和预处理步骤。 ## 2) 生成二值嵌入 接下来,我们生成文本嵌入(float32 格式),并将其转换为二进制向量,从而减少 32 倍的内存和存储空间。 这叫做二进制量化。 ## 3)向量索引 完成二进制量化后,我们将向量存储在 Milvus 向量数据库中并建立索引,以便高效检索。 索引是专门用于优化数据检索操作性能的数据结构。 ## 4)检索 在检索阶段,我们: - 嵌入用户查询并对其应用二进制量化。 - 使用汉明距离作为搜索度量来比较二进制向量。 - 找出最相似的 5 个数据块。 - 将检索到的数据块添加到上下文中。 这是实现方式: ## 5)世代 接下来,我们使用 Kimi-K2 指令模型构建生成管道,该模型由 Groq 提供最快的 AI 推理服务。 我们在提示模板中指定查询和检索到的上下文,并将其传递给 LLM。 最后,我们用 Streamlit 界面完成了整个项目! 为了评估规模和推理速度,我们在 PubMed 数据集(3600 万个向量)上测试了该设置。 以下是一个演示:  我们的应用程序: - 在不到 30 毫秒内查询了 3600 万个以上的向量。 - 在不到 1 秒内生成了响应。 完毕! 我们刚刚构建了速度最快的 RAG 堆栈,利用 BQ 实现高效检索, 采用超快速的无服务器部署方式实现我们的人工智能工作流程。 代码可在此处获取:https://github.com/patchy631/ai-engineering-hub/tree/main/fastest-rag-milvus-groq 以下是工作流程,供您参考 👇  需要注意的是,二进制量化使得矢量搜索层效率极高。但在实际生产环境中,检索很少仅仅是矢量查找。 实际应用中的智能体会同时从 Slack、GitHub、Jira、数据库和文档中提取上下文信息。这意味着身份验证、同步、查询路由、权限和重新排序等问题,都与嵌入式搜索本身一样,成为首要考虑因素。 因此,请将 BQ 视为检索基础设施中一个强大的组成部分,而不是全部。您的矢量图层速度越快、结构越精简,您就越有余力投入到其他所有能够真正实现大规模检索的要素上。 我在最近的一篇文章中介绍了完整的检索基础设施是什么样子,详细分析了像谷歌和微软这样的公司是如何为其生产代理提供上下文的。 请阅读以下内容: 拍摄结束! 如果您喜欢这篇教程: 找到我 →@_avichawla 我每天都会分享关于数据科学、机器学习、LLM 和 RAG 的教程和见解。 ## 相关链接 - [Avi Chawla](https://x.com/_avichawla) - [@_avichawla](https://x.com/_avichawla) - [32K](https://x.com/_avichawla/status/2040326889928356122/analytics) - [https://github.com/patchy631/ai-engineering-hub/tree/main/fastest-rag-milvus-groq](https://github.com/patchy631/ai-engineering-hub/tree/main/fastest-rag-milvus-groq) - [Mar 30](https://x.com/_avichawla/status/2038542325186724124) - [15K](https://x.com/_avichawla/status/2038542325186724124/analytics) - [@_avichawla](https://x.com/@_avichawla) - [升级至高级版](https://x.com/i/premium_sign_up) - [3:13 PM · Apr 4, 2026](https://x.com/_avichawla/status/2040326889928356122) - [32.5K Views](https://x.com/_avichawla/status/2040326889928356122/analytics) - [View quotes](https://x.com/_avichawla/status/2040326889928356122/quotes) --- *导出时间: 2026/4/5 03:14:59*
私 私有知识库从 demo 到生产,中间差了 8 层工程 文章探讨了私有知识库项目在实际落地中遇到的挑战。许多 Demo 看起来聪明,但在生产环境中常因检索链路混乱而答非所问。作者指出单纯升级模型无济于事,根本在于构建稳固的 RAG 底座。文章详细拆解了从数据源、解析、清洗、切分、Embedding 到索引、检索、生成及评估的 8 层最小可用架构,并阐述了 Agentic RAG 如何通过决策层优化检索策略。最后提供了从 0 到 1 的搭建步骤及技术选型建议,强调权限过滤、混合检索与持续评估的重要性。 技术 › LLM ✍ Ando🕐 2026-07-08 RAG私有知识库Agentic向量检索工程架构LlamaIndexLangChain
《 《指挥 AI,做出一个企业级 Agent》08:企业 RAG 不是上传几个 PDF 文章指出企业 RAG 不仅仅是上传 PDF 回答问题,更需关注文档版本、权限、来源追溯及停用管理。作者通过模拟企业真实文档环境,构建了包含版本控制和过滤机制的评测体系,强调了可靠检索与诚实无答案的重要性,并分享了针对小规模知识库的技术选型经验。 技术 › Agent ✍ jager🕐 2026-07-22 RAG企业级Agent版本控制向量检索评测Embedding知识库技术选型
深 深入理解 AI Agent:设计原理与工程实践 李博杰新书《深入理解 AI Agent:设计原理与工程实践》开源,涵盖从0到1构建生产级AI Agent的原理与代码,包括RAG、工具调用、多Agent协作等实战内容。 技术 › Agent ✍ 李博杰🕐 2026-07-15 AI Agent开源LLMRAG工具调用多模态编程工程实践生产级代码
R RAG 像素级拆解实战:索引、混合检索与评测体系 本文通过 Notebook 实战项目,对 RAG 系统的索引与检索过程进行了深度解析。内容涵盖文档切分(Chunking)、SQLite FTS5 倒排索引、BM25 关键词检索、向量 Embedding 语义检索,以及基于 RRF 的混合检索召回策略。此外,文章还介绍了如何构建评测集来验证检索效果,提供了完整的代码与数据结构示例,旨在帮助开发者理解 RAG 底层运作原理与工程实践细节。 技术 › LLM ✍ MateMatt🕐 2026-07-12 RAG检索增强生成向量检索BM25混合检索Embedding倒排索引Python实战教程评测
A Agent 的数据面概念扫盲-建立技术侧认知体系 本文深入解析了 Agent 数据面的核心概念,将其比作操作系统的内存管理单元。文章详细阐述了 Context Engineering 的演变、Session/Thread/Profile 的架构差异,以及 Session Memory 与 Long-term Memory 的区别。作者还重点介绍了 Hermes 中的 Memory 设计方案、SQLite FTS5 与 BM25 算法原理,以及向量检索与关键词检索在 RAG 中的混合应用,旨在为开发者建立一套完整的 Agent 数据面技术认知体系。 技术 › Agent ✍ MateMatt🕐 2026-07-12 AgentContext EngineeringRAGMemoryBM25SQLite FTS5向量检索HermesLong-term MemoryLLM
私 私有知识库第4篇:评估集 + 增量更新,让 RAG 能长期跑下去 文章探讨了 RAG(检索增强生成)系统长期运行的两大难题:评估与更新。作者提出建立包含50个问题的“评估集”,通过 Recall、Precision 和 LLM 辅助的答案准确率来量化系统效果,避免盲目调参。同时,针对文档更新导致的全量重建成本问题,介绍了基于内容 Hash 的增量更新策略,仅处理变动文档,大幅降低资源消耗与停机时间。 技术 › LLM ✍ Ando🕐 2026-07-08 RAG评估指标增量更新Embedding向量检索私有知识库LLM应用数据处理系统优化Hash算法
L LlamaIndex 用 Rust 重写文档解析器 LiteParse LlamaIndex 推出完全用 Rust 重写的文档解析器 LiteParse。相比旧版,新版本在处理大文档时速度提升 3 倍,小文档提升可达 100 倍,实测 457 页 PDF 解析仅需 0.777 秒。该工具支持 Python、Node.js、Rust 及浏览器环境,覆盖 PDF、Office 等主流格式,具备原生 OCR 能力,且可作为 Agent Skill 直接集成。 技术 › 工具与效率 ✍ Jason Zhu🕐 2026-05-28 LlamaIndexRust文档解析OCRAgent SkillRAG开源性能优化
A Agent Memory Framework: Remember, Cite, Forget 本文提出了一个智能体记忆系统的可靠框架,该框架需同时完成三个核心任务:记住该记的、引用可信的、遗忘过期的。文章详细介绍了记忆的六个层级(如会话状态、项目记忆、索引检索等),阐述了如何通过权威排序解决冲突,并强调了通过硬过期、双时序或软衰减等机制让旧记忆失效的重要性。 技术 › Agent ✍ Vox🕐 2026-05-23 AgentMemoryRAGLangGraphMem0ZepGBrainLLM系统架构工程实践
不 不做中转,不卖课,如何用 AI 月入 10万 作者分享了今年通过接企业知识库项目实现月入数万的实战经验。文章详细阐述了如何将基础 RAG 升级为企业级 RAG 系统,重点涵盖数据处理层面的文档切分策略(针对 PDF、Excel、代码等)、向量化模型选择及数据库选型;同时深入讲解了检索策略优化,包括长问题处理、混合检索、Rerank 精排及多因素加权排序等技术细节。 技术 › LLM ✍ Miles.🕐 2026-05-12 RAG企业级向量数据库Embedding检索增强技术变现Knowledge BaseMilvus搜索算法数据切分
多 多Agent场景下数据读写不同步的解决方案 本文探讨了在多Agent系统中,子Agent之间数据读写不同步的问题。根本原因在于单Agent场景设计的默认数据库一致性配置(如Milvus的Bounded级别)无法满足多Agent毫秒级的读写需求。文章详细解释了Milvus的写入机制和四档一致性级别,并通过实验证明将一致性级别从默认的Bounded切换为Strong可以有效解决“写后读空”的问题。 技术 › Agent ✍ 尹珉🕐 2026-05-07 多AgentMilvus数据一致性向量数据库RAGStrongBounded读写同步分布式系统
小 小白如何从0到1搭建自己的AI知识库 本文介绍了如何从零开始搭建个人AI知识库。作者提出了一套包含文本文件、Agent工具、规则和真实任务的工作方式,并详细说明了准备四样要素(开放文件夹、真实任务、Agent工具、工作规则)和五个具体步骤的方法,帮助用户通过简单的流程实现知识的积累与迭代。 技术 › 工具与效率 ✍ 金尘马🕐 2026-07-30 AI知识库AgentWorkBuddyCodexMarkdown提示词个人管理RAG生产力
做 做完一次总体设计后,我重新理解了企业级知识库 文章基于企业级智能知识库项目的实践,探讨了企业知识库的真正门槛。指出其不仅是文档存储,更是一套涵盖构建、治理、使用和优化的闭环运行机制。重点分析了知识库与知识空间的区别、知识生命周期管理、可信溯源及权限控制,强调知识库应作为支撑未来 Agent 的企业级 AI 知识引擎。 技术 › LLM ✍ 土猛的员外🕐 2026-07-29 企业知识库RAGAgent知识工程架构设计