Math Behind Large Language Model
本文介绍了大语言模型背后的数学原理,涵盖Attention机制、缩放因子、反向传播、梯度下降、交叉熵损失、RoPE位置编码和RMSNorm归一化等核心概念。
本文介绍了大语言模型背后的数学原理,涵盖Attention机制、缩放因子、反向传播、梯度下降、交叉熵损失、RoPE位置编码和RMSNorm归一化等核心概念。
这是一份关于 PyTorch 训练流程的单页速查表。文章通过代码示例和原理解析,深入浅出地讲解了张量的核心概念、矩阵乘法、自动求导机制、反向传播以及梯度下降优化过程。同时涵盖了 `nn.Module` 常用组件如 Linear、ReLU 和 GELU 的使用,旨在帮助开发者快速理解深度学习引擎的运作原理。
本文是一篇硬核技术教程,详细记录了如何不依赖任何外部库,仅使用纯 C 语言从零构建一个可用的 GPT(Generative Pre-trained Transformer)模型。文章涵盖了从随机数生成、数据分词、模型架构定义,到手动实现反向传播、Adam 优化器及推理采样的全过程。通过手写矩阵乘法、注意力机制和神经网络层,帮助读者深入理解 LLM 的底层原理。