📚 Wiki 知识库

🏷️ 性能优化

14 篇

Introducing pgContext 0.2.0: Advanced AI search inside Postgres

pgContext 0.2.0 发布,作为 PostgreSQL 的开源扩展,提供更快的语义搜索、过滤和混合检索功能。新版本优化了性能,增加了搜索透明度和安全性,支持更多 AI 搜索方法,适用于推荐系统和低成本检索。用户可通过源代码、容器或 Docker Compose 使用。

技术数据库 ✍ dale🕐 2026-07-24

LLM 推理原理详解:从 Prefill 到 Decode

本文深入解析了大语言模型(LLM)推理的计算流程。文章指出,LLM 推理主要包含 Prefill(处理提示词,计算密集型)和 Decode(逐词生成,显存带宽密集型)两个阶段。作者详细阐述了分词、Embedding、Transformer 层及 KV Cache 的工作原理,并分析了 KV Cache 带来的内存挑战及 vLLM 的优化方案。最后,探讨了 DeepSeek-V4 等新架构通过重新设计注意力机制来从根本上压缩 KV Cache 的创新思路。

技术LLM ✍ Avi Chawla🕐 2026-06-29

构建优秀的垂直领域 Agent:以 Shortcut 为例

本文探讨了如何构建一个在实际应用中表现卓越的垂直领域 Agent。作者结合开发 Shortcut 电子表格 Agent 的经验,提出核心原则是“对任务分布的忠实压缩”。文章详细介绍了“分层缓存”架构,将上下文分为 L1(常驻核心)、L2(按需规格)和 L3(兜底参考),以平衡效率与准确性。同时强调了“单工具优于多工具”的策略,主张通过代码执行来统一能力,降低模型决策复杂度,从而在长尾任务中实现高准确率。

技术Agent ✍ Peter Wang🕐 2026-06-12

基于 Claude Design 与 Agent 的高效开发模式实践

本文作者分享了探索出的一套高效开发模式。首先利用 Claude Design 进行 UI/UX 设计,生成包含 HTML、CSS、React 和 data.js 的代码交付物,这比传统设计稿更易于 AI 理解和版本管理;随后使用 Claude Opus 4.8 结合 Codex 实现 MVP 和功能迭代;最后通过重构优化性能。此外,作者通过逆向工程将 Claude Design 本地化并集成到 Cursor 中,实现了更流畅的工作流。

技术Claude ✍ 宝玉🕐 2026-06-08

LlamaIndex 用 Rust 重写文档解析器 LiteParse

LlamaIndex 推出完全用 Rust 重写的文档解析器 LiteParse。相比旧版,新版本在处理大文档时速度提升 3 倍,小文档提升可达 100 倍,实测 457 页 PDF 解析仅需 0.777 秒。该工具支持 Python、Node.js、Rust 及浏览器环境,覆盖 PDF、Office 等主流格式,具备原生 OCR 能力,且可作为 Agent Skill 直接集成。

技术工具与效率 ✍ Jason Zhu🕐 2026-05-28

下一代 LLM 推理网络:ZCube 如何缓解网络瓶颈

文章探讨了随着长上下文推理和 Prefill-Decode 解耦成为主流,网络如何成为 LLM 推理集群吞吐量和延迟的关键瓶颈。Z.ai、Harnets.AI 和清华大学联合开发了 ZCube 网络架构,通过扁平化拓扑和混合轨道设计,有效解决了传统 ROFT 架构下的流量负载不均衡问题。生产环境基准测试显示,ZCube 仅通过架构优化便实现了交换机成本降低 33%、吞吐量提升 15% 以及 TTFT 延迟降低 40.6% 的显著收益。

技术DevOps ✍ Z.ai🕐 2026-05-21

单智能体与多智能体解决方案的选择指南

文章探讨了在大语言模型时代,如何权衡使用单智能体与多智能体系统。引用斯坦福及Google/MIT的研究指出,多智能体系统并非总是更优,往往伴随着更高的计算成本、延迟和通信开销,且在“思考预算”相当的情况下,优化后的单智能体常能胜出。文章建议将单智能体作为默认起点,仅当任务涉及大量工具、上下文退化严重、存在自然解耦边界或需严格合规验证时,才考虑引入多智能体架构。

技术Agent ✍ AlphaSignal AI🕐 2026-05-07

LLM 优化面试笔记:训练与推理核心技术

这是一份针对 AI 实验室面试准备的笔记,涵盖了高效训练和部署大语言模型(LLM)的核心优化策略。内容主要分为三部分:内存优化(如 Flash Attention、MQA/GQA、激活检查点)、计算优化(序列打包、高效变体 Transformer)以及推理优化(KV 缓存、投机解码、量化技术)。文章旨在总结在大规模模型开发中应对算力和内存瓶颈的关键技术。

技术LLM ✍ Gauri Gupta🕐 2026-05-06

为 Mintlify AI 助手构建虚拟文件系统

文章探讨了如何通过构建虚拟文件系统 ChromaFs 来优化 Mintlify 的 AI 文档助手。作者指出传统的沙箱克隆方案存在高延迟(约 46 秒)和高成本(年费超 7 万美元)的问题。ChromaFs 通过拦截 Unix 命令并将其转换为 Chroma 数据库查询,实现了零边际计算成本和毫秒级的会话启动速度。文章详细介绍了 ChromaFs 的架构、目录树引导、权限控制、分块重组以及针对 grep 命令的优化策略。

技术LLM ✍ Dens Sumesh🕐 2026-05-06

后端工程师必知的20个并发编程核心概念

Atlassian 首席工程师总结的后端面试与系统设计中的 20 个并发编程核心概念。文章涵盖了从基础的并发与并行、进程线程区别,到互斥锁、信号量、死锁、CAS、线程池及生产者-消费者模式等进阶主题。旨在帮助工程师掌握并发原语,理解性能权衡,从而构建可靠的生产级系统。

技术后端 ✍ Puneet Patwari🕐 2026-04-22

全网首发!Nexu Windows 客户端百亿 Token 实战:打包性能优化与 CI 建设

本文详细介绍了开源项目 Nexu(基于 OpenClaw 的桌面客户端)在支持 Windows 平台过程中遇到的工程挑战及解决方案。团队通过抛弃默认打包流程,采用自定义的 7z 压缩与 NSIS 安装器方案,成功将安装时间从 10 分钟缩短至 2 分钟,并引入 Update Driver 抽象实现了跨平台更新逻辑的彻底解耦。此外,文章还分享了基于 GitHub Actions 的全自动化 CI 流程实践,旨在为 Electron 跨平台交付提供参考。

技术DevOps ✍ Tom Huang🕐 2026-04-15

LLM 中的 KV 缓存机制详解

文章深入解释了大型语言模型(LLM)中的 KV 缓存技术。作者指出,LLM 生成文本时首个令牌较慢而后续令牌迅速的现象,归功于 KV 缓存的工程优化。该技术通过存储已计算键值向量,避免在自回归生成过程中的冗余计算,以 GPU 内存为代价换取显著的计算加速。文中详细解析了注意力机制的冗余问题、KV 缓存的工作原理、首令牌延迟(TTFT)的产生原因,以及内存与计算资源之间的权衡取舍。

技术LLM ✍ Avi Chawla🕐 2026-03-22