📚 Wiki 知识库

大语言模型训练与服务背后的数学原理

Saito🕐 2026-05-01📦 8.1 KB 🟢 已读 𝕏 文章列表

本文基于 Reiner Pope 的播客内容,深入剖析了大模型在集群中的运行机制。文章通过 Roofline 分析和 KV Cache 等核心概念,解释了推理延迟、Batch Size、API 定价策略及 MoE 架构背后的物理与经济逻辑,揭示了硬件限制如何塑造 AI 进展。