📚 Wiki 知识库

🏷️ CUDA

4 篇

RTX 3090 上实现 Qwen3.5-27B 模型 207 tok/s 推理速度的技术实践

文章介绍了如何通过构建独立的 C++/ggml 推测解码器,在单张 RTX 3090 (24GB) 显卡上实现了 Qwen3.5-27B (Q4_K_M) 模型的高效推理。利用 DFlash block-diffusion draft 和 DDTree 验证器,成功将峰值解码速度提升至 207.6 tok/s,较自回归基准提升约 5.46 倍,并实现了在有限显存下运行 128K 长上下文的能力。

技术LLM ✍ Sandro🕐 2026-04-21

两小时激辩:黄仁勋谈 Nvidia 使命、TPU 竞争与出口管制

本文详细记录了黄仁勋与 Dwarkesh Patel 的两小时专访。黄仁勋重申了 Nvidia “输入电子,输出 Token” 的使命,并深入探讨了 CUDA 的生态护城河、供应链管理哲学以及对 GPU 定价的看法。针对 TPU 和 Trainium 的竞争,他认为专用芯片是特例而非趋势。文章最精彩的部分在于关于对华出口管制的激烈辩论,黄仁勋强烈反对将 AI 芯片武器化,认为限制出口只会倒逼中国实现完全自主化,让美国失去市场。

技术LLM ✍ 宝玉🕐 2026-04-18

黄仁勋最新访谈:谈Nvidia护城河、AI未来与中国算力

黄仁勋在2.4万字访谈中深入探讨了Nvidia的定位与护城河,反对AI取代就业论,强调智能体将指数级增长。他回顾了错失Anthropic投资的遗憾,解释为何不涉足云服务,并针对中国芯片限制提出“五层蛋糕”论,认为电力可弥补工艺差距,断供将迫使中国建立独立技术栈。

技术LLM ✍ 外汇交易员🕐 2026-04-16