人工智能的工程全景:模型之外的另一半(上)
文章详细梳理了人工智能的工程基础,回顾了从GPU游戏显卡到英伟达CUDA生态建立的历史,解析了其技术护城河。同时指出2026年硬件格局的松动,分析了谷歌TPU的回归与AWS自研芯片的崛起,展示了英伟达在推理领域面临的竞争态势。
文章详细梳理了人工智能的工程基础,回顾了从GPU游戏显卡到英伟达CUDA生态建立的历史,解析了其技术护城河。同时指出2026年硬件格局的松动,分析了谷歌TPU的回归与AWS自研芯片的崛起,展示了英伟达在推理领域面临的竞争态势。
文章介绍了如何通过构建独立的 C++/ggml 推测解码器,在单张 RTX 3090 (24GB) 显卡上实现了 Qwen3.5-27B (Q4_K_M) 模型的高效推理。利用 DFlash block-diffusion draft 和 DDTree 验证器,成功将峰值解码速度提升至 207.6 tok/s,较自回归基准提升约 5.46 倍,并实现了在有限显存下运行 128K 长上下文的能力。
本文详细记录了黄仁勋与 Dwarkesh Patel 的两小时专访。黄仁勋重申了 Nvidia “输入电子,输出 Token” 的使命,并深入探讨了 CUDA 的生态护城河、供应链管理哲学以及对 GPU 定价的看法。针对 TPU 和 Trainium 的竞争,他认为专用芯片是特例而非趋势。文章最精彩的部分在于关于对华出口管制的激烈辩论,黄仁勋强烈反对将 AI 芯片武器化,认为限制出口只会倒逼中国实现完全自主化,让美国失去市场。
黄仁勋在2.4万字访谈中深入探讨了Nvidia的定位与护城河,反对AI取代就业论,强调智能体将指数级增长。他回顾了错失Anthropic投资的遗憾,解释为何不涉足云服务,并针对中国芯片限制提出“五层蛋糕”论,认为电力可弥补工艺差距,断供将迫使中国建立独立技术栈。