📚 Wiki 知识库

🏷️ 推理

12 篇

Maybe Intelligence Ain't All That

文章讨论了超级智能的到来并没有带来预期的剧烈变革。作者认为,虽然AI在代码、法律等领域表现出色,但真正的限制在于与现实的接触。复杂系统的问题无法仅靠推理解决,需要实际验证。尽管AI将带来巨大进步,但不会出现突然的“起飞”或不可理解的未来。

技术LLM ✍ Clifford Sosin🕐 2026-07-20

LLM 推理原理详解:从 Prefill 到 Decode

本文深入解析了大语言模型(LLM)推理的计算流程。文章指出,LLM 推理主要包含 Prefill(处理提示词,计算密集型)和 Decode(逐词生成,显存带宽密集型)两个阶段。作者详细阐述了分词、Embedding、Transformer 层及 KV Cache 的工作原理,并分析了 KV Cache 带来的内存挑战及 vLLM 的优化方案。最后,探讨了 DeepSeek-V4 等新架构通过重新设计注意力机制来从根本上压缩 KV Cache 的创新思路。

技术LLM ✍ Avi Chawla🕐 2026-06-29

LLM 原理与实践指南 (2026 版)

这是一份关于大语言模型(LLM)的实践指南。文章从基础循环机制出发,详细解释了文本如何转化为 Token,以及 Transformer、注意力机制、KV Cache 和 RoPE 等核心概念的工作原理。作者强调理解模型内部的推理机制(如 Prefill 和 Decode 阶段)对于硬件选型、显存估算和本地部署的重要性。文章涵盖了 Token 化、上下文窗口、量化、模型服务及本地 AI 硬件数学计算等关键主题,旨在为深入理解 LLM 提供直观的基础。

技术LLM ✍ Ahmad🕐 2026-05-23

下一代 LLM 推理网络:ZCube 如何缓解网络瓶颈

文章探讨了随着长上下文推理和 Prefill-Decode 解耦成为主流,网络如何成为 LLM 推理集群吞吐量和延迟的关键瓶颈。Z.ai、Harnets.AI 和清华大学联合开发了 ZCube 网络架构,通过扁平化拓扑和混合轨道设计,有效解决了传统 ROFT 架构下的流量负载不均衡问题。生产环境基准测试显示,ZCube 仅通过架构优化便实现了交换机成本降低 33%、吞吐量提升 15% 以及 TTFT 延迟降低 40.6% 的显著收益。

技术DevOps ✍ Z.ai🕐 2026-05-21

LLM 优化面试笔记:训练与推理核心技术

这是一份针对 AI 实验室面试准备的笔记,涵盖了高效训练和部署大语言模型(LLM)的核心优化策略。内容主要分为三部分:内存优化(如 Flash Attention、MQA/GQA、激活检查点)、计算优化(序列打包、高效变体 Transformer)以及推理优化(KV 缓存、投机解码、量化技术)。文章旨在总结在大规模模型开发中应对算力和内存瓶颈的关键技术。

技术LLM ✍ Gauri Gupta🕐 2026-05-06

英伟达推理份额大降,AI革命进入二阶段机会在哪?

文章深入分析了 AI 从训练时代进入推理时代的投资机遇。随着推理成本占比提升至 80%-90%,算力需求呈几何级增长,但英伟达在推理市场的份额已下滑至 60-75%。AMD 凭借大显存优势及 OpenAI 等巨头的订单,正在抢占市场。ASIC 定制芯片也成新势力。文章对比了英伟达与 AMD的投资逻辑:英伟达仍是行业 beta,而 AMD 是份额转移的直接受益者。

投资股票 ✍ 大宇🕐 2026-05-04

光互联深度:当算力撞上物理边界,人类又一次问光

文章深入探讨了 AI 时代算力发展面临的物理瓶颈,指出光互联是解决 GPU 之间、机柜之间高速通信的关键路径。随着 AI 进入推理时代,大模型长上下文和 Agent 任务对带宽和延迟提出了极高要求,英伟达的 NVLink 协议虽然建立了深厚护城河,但铜缆技术已达极限,产业正加速向光互连(如 CPO、硅光子)转型。文中还详细对比了 Scale-up 与 Scale-out 架构,以及 UALink 开放联盟对英伟达的挑战。

投资宏观产业 ✍ 大宇🕐 2026-05-04

HBM全景研报:从训练到推理,主角不再是GPU

本文深入分析了AI推理时代HBM(高带宽内存)成为新主角的原因,指出推理过程中数据搬运的耗时往往超过计算。文章详细解释了HBM的3D堆叠技术优势、HBM4采用先进逻辑工艺带来的产业链变化,以及SK海力士、三星、美光三大厂商的市场份额与技术路线竞争,并探讨了内存厂商在AI基础设施中获取超高利润的商业逻辑。

投资宏观经济 ✍ 大宇🕐 2026-05-04

万物互联:深入理解知识图谱

文章通过形象的人类联想记忆引入,阐述了知识图谱如何解决传统关系型数据库在处理复杂、多跳关系时的局限性。详细介绍了知识图谱的核心构成(节点、边、属性)及本体概念,展示了其在城市关系建模和推理中的强大能力。最后对比了不同数据模型,指出知识图谱在关系复杂度极高的场景下具有独特优势。

技术后端 ✍ ramakrushna🕐 2026-04-12