📚 Wiki 知识库

全部文档

8 篇
清除

LLM 推理原理详解:从 Prefill 到 Decode

本文深入解析了大语言模型(LLM)推理的计算流程。文章指出,LLM 推理主要包含 Prefill(处理提示词,计算密集型)和 Decode(逐词生成,显存带宽密集型)两个阶段。作者详细阐述了分词、Embedding、Transformer 层及 KV Cache 的工作原理,并分析了 KV Cache 带来的内存挑战及 vLLM 的优化方案。最后,探讨了 DeepSeek-V4 等新架构通过重新设计注意力机制来从根本上压缩 KV Cache 的创新思路。

技术LLM ✍ Avi Chawla🕐 2026-06-2912.1 KB

AI 第二大脑搭建指南:从 Wiki 到知识图谱

文章探讨了 AI 第二大脑的演进,指出简单的 Wiki 模式无法适应工作中不断演变的上下文,并推荐了基于知识图谱的开源工具 Rowboat。文中详细介绍了 Rowboat 的安装配置、本地化部署(支持 Ollama/OpenAI)、与 Obsidian 的集成,以及如何通过连接 Gmail、日历和会议记录,自动提取决策、承诺和截止日期,构建一个完全本地化且具备上下文感知能力的智能工作系统。

技术Agent ✍ Avi Chawla🕐 2026-05-0713.0 KB

Claude Subagents vs. Agent Teams:多智能体系统架构指南

文章深入探讨了 Claude 中的两种多智能体范式:Sub-agents 和 Agent Teams。Sub-agents 类似于独立上下文的临时工,适合并行处理孤立任务;而 Agent Teams 是持久化的协作团队,通过共享状态和直接通信解决复杂协调问题。文章建议根据任务所需的上下文依赖性选择架构,并介绍了五种主要的编排模式,强调应基于上下文而非角色来拆分任务。

技术Agent ✍ Avi Chawla🕐 2026-05-0211.1 KB

顶级AI实验室如何构建RL智能体:从RLHF到RULER的演进

文章探讨了 Anthropic、OpenAI 和 DeepSeek 等顶尖 AI 实验室在 2026 年关于强化学习(RL)的趋同思路,即使用系统提示作为奖励函数。内容详细梳理了 RL 在 LLM 中的应用历程,从 RLHF 到 RULER(Karpathy 提出的系统提示学习概念)的演变。重点介绍了 DeepSeek R1 利用可验证奖励(RLVR)突破传统瓶颈的机制,通过规则编译器直接提供信号,并结合 GRPO 算法移除了复杂的 Critic 和奖励模型,实现了从 15.6% 到 77.9% 的 AIME 数学成绩飞跃。

技术LLM ✍ Avi Chawla🕐 2026-04-2832.2 KB

LLM 中的 Prompt Caching 技术详解:以 Claude 为例的高效缓存策略

本文深入探讨了 LLM 中的 Prompt Caching 技术,解释了其背后的 KV Cache 机制及静态/动态上下文分离原理。文章通过 Claude Code 的案例分析,展示了如何通过保持 92% 的缓存命中率来将计算成本降低 81%,并总结了哈希敏感性和工程化落地的关键约束。

技术LLM ✍ Avi Chawla🕐 2026-04-2010.8 KB

LLM 提示词缓存原理与实战应用

文章深入探讨了LLM中的提示词缓存技术。通过区分静态前缀(如系统指令)和动态后缀(如用户消息),利用KV Cache机制避免重复计算,大幅降低长上下文任务的成本。文章以Claude Code为例,展示了如何通过保持92%的缓存命中率将成本降低81%。同时,强调了Hash缓存的脆弱性,任何微小的前缀变动都会导致缓存失效,并给出了在开发Agent时维持缓存热度的具体工程建议。

技术LLM ✍ Avi Chawla🕐 2026-04-1610.7 KB

如何提高 RAG 32x 的内存效率(附代码说明)

本文介绍了利用二进制量化技术将 RAG(检索增强生成)系统内存效率提高 32 倍的方法。作者以 Perplexity 和 Azure 为例,详细展示了如何使用 Llama Index、Milvus 向量数据库和 Groq 托管的 Kimi-K2 模型构建系统。该系统可在 30 毫秒内查询 3600 万个向量,并在 1 秒内生成响应。文章提供了从数据加载、生成二值嵌入、向量索引到检索生成的完整代码实现。

技术LLM ✍ Avi Chawla🕐 2026-04-055.4 KB

LLM 中的 KV 缓存机制详解

文章深入解释了大型语言模型(LLM)中的 KV 缓存技术。作者指出,LLM 生成文本时首个令牌较慢而后续令牌迅速的现象,归功于 KV 缓存的工程优化。该技术通过存储已计算键值向量,避免在自回归生成过程中的冗余计算,以 GPU 内存为代价换取显著的计算加速。文中详细解析了注意力机制的冗余问题、KV 缓存的工作原理、首令牌延迟(TTFT)的产生原因,以及内存与计算资源之间的权衡取舍。

技术LLM ✍ Avi Chawla🕐 2026-03-226.3 KB