900万参数,130行代码:从零构建微型语言模型 GuppyLM 教程 ✍ Jason Zhu🕐 2026-04-07📦 7.5 KB 🟢 已读 𝕏 文章列表 本文介绍了开发者 arman-bd 开源的微型语言模型 GuppyLM。该模型拥有 900 万参数,核心代码仅 130 行,可在免费 Colab 上 5 分钟训练完成。文章详细拆解了构建流程:利用模板生成 6 万条合成数据、训练 4096 词表的 BPE 分词器、搭建 6 层 Vanilla Transformer 架构以及优化推理环节。该项目旨在通过极简的实现,帮助开发者深入理解语言模型的数据工程、架构设计与训练循环。 GuppyLM模型训练TransformerPyTorchBPE分词器合成数据教程开源深度学习 # 900万参数,130行代码,5分钟训练:一个从零构建语言模型的完整教程 **作者**: Jason Zhu **日期**: 2026-04-07T02:19:07.000Z **来源**: [https://x.com/GoSailGlobal/status/2041339961593708673](https://x.com/GoSailGlobal/status/2041339961593708673) ---  开发者 arman-bd 在 Hacker News 上分享了他从零构建的微型语言模型 GuppyLM,900 万参数,130 行 PyTorch 核心代码,在免费 Colab 上 5 分钟训练完成。整个项目把大模型最核心的五个环节全拆开了:数据生成、分词器训练、模型架构、训练循环、推理对话 ## 为什么是一条鱼  GuppyLM 的设定是一条叫 Guppy 的小鱼,只会用小写字母聊水、食物和鱼缸生活,完全不理解人类的抽象概念。这个设定的目的是把问题域压到最小。当你的模型只有 900 万参数的时候,让它学会通用对话是不现实的,但让它在一个极窄的领域里表现得像模像样,完全可以做到 这就是 GuppyLM 的教学价值所在。它把"训练一个语言模型"这件事从需要几千美元 GPU 算力的工程问题,变成了一个免费 Colab 就能跑通的学习项目 ## 6 万条合成数据怎么造  GuppyLM 的训练数据完全是合成的,6 万条对话,57000 条训练集,3000 条测试集,覆盖 60 个话题类别 生成方式是模板组合加随机化。项目里预设了 30 种鱼缸物件、17 种食物类型、25 种活动,通过排列组合生成大约 16000 条独特输出。话题从打招呼、情绪、环境条件到光线、海洋生物、人类互动都有覆盖 数据格式很简单,每条记录三个字段:input 是用户问题,output 是 Guppy 的回答,category 是话题分类。整个数据集开源在 HuggingFace 的 arman-bd/guppylm-60k-generic 这个方案的关键洞察:对于教学目的的微型模型,合成数据完全够用。你不需要去爬互联网,不需要处理数据清洗的各种坑,用模板就能造出质量稳定、分布均匀的训练集 ## BPE 分词器:4096 个 token 够用吗  GuppyLM 用的是 BPE 分词器,词表大小只有 4096。作为对比,GPT-4 的词表是 10 万级别,LLaMA 是 32000 4096 够用的原因还是那个极窄的问题域。Guppy 只需要表达跟水、食物、鱼缸相关的概念,不需要覆盖整个人类语言。分词器直接在合成数据集上训练,所以词表里每个 token 都是高频使用的,没有浪费 实际操作就一步:用 tokenizers 库的 BPE 训练器,喂入全部训练文本,设定 vocab_size=4096,输出一个分词器模型文件。后续训练和推理都用这个分词器做文本编码解码 ## 6 层 Transformer 的完整架构  GuppyLM 的模型架构是标准的 Vanilla Transformer,刻意不用任何现代优化技巧。6 层 Transformer Block,隐藏维度 384,6 个注意力头,FFN 维度 768 用 ReLU 激活,上下文窗口 128 个 token 位置编码用的是 Learned Embeddings,不是 RoPE。归一化用 LayerNorm,不是 RMSNorm。语言头和 Embedding 层做了权重共享,这是个经典的参数节省技巧 为什么故意不用现代优化。没有 GQA(分组查询注意力),没有 RoPE(旋转位置编码),没有 SwiGLU 激活函数。项目的目标是教学,用最基础的组件让你看清 Transformer 的每一个零件怎么工作。当你理解了 Vanilla 版本,再去看 LLaMA 和 Mistral 加了什么改进,就能明白每个优化解决的是什么问题 整个模型 870 万参数,model.py 一个文件就能看完全部架构代码 ## 训练循环:5 分钟跑完  训练用标准的因果语言建模,也就是 next-token prediction。优化器用 AdamW,学习率调度用 Cosine Annealing,训练过程开了 AMP 混合精度加速 在 Colab 免费的 T4 GPU 上,整个训练过程大约 5 分钟完成。这个速度得益于三个因素:模型够小(870 万参数),数据够少(6 万条),上下文够短(128 token) 一个重要的设计决策:GuppyLM 只做单轮对话,不支持多轮。开发者测试发现多轮对话在第 3-4 轮之后质量严重退化,128 token 的上下文窗口装不下对话历史。与其给用户一个越聊越差的体验,不如直接限制为单轮,每次对话都是最佳质量 另一个决策是取消 System Prompt。900 万参数的模型没有能力做条件指令跟随,把人设直接训进权重里,每次推理还能省掉大约 60 个 token 的上下文开销 ## 推理和部署  训练完成后有两种使用方式。第一种是用 Colab notebook 直接跑,打开 use_guppylm.ipynb,自动从 HuggingFace 下载预训练权重,就能开始对话。第二种是本地运行,pip install torch tokenizers 然后 python -m guppylm chat 推理过程用 Temperature Sampling,温度参数可调。因为只做单轮对话,不需要维护对话历史,每次输入一个问题,模型生成一个回答,状态清零 整个项目的代码结构也很清晰。config.py 管超参数,model.py 是模型定义,dataset.py 处理数据加载,train.py 是训练循环,generate_data.py 生成合成数据,prepare_data.py 预处理和训练分词器,inference.py 是交互式对话接口。加上 tools 目录下的辅助脚本,总共不到 300 行核心代码 ## 从 GuppyLM 能学到什么 这个项目最大的价值不在于模型本身的能力,在于它把语言模型的每个环节都拆到了可以单独理解的粒度 数据层面,合成数据 + 模板组合就能造出够用的训练集,不需要大规模爬取和清洗 分词层面,BPE 分词器的训练过程只需要几行代码,词表大小跟你的问题域匹配就行 架构层面,Vanilla Transformer 的每个组件都有明确的功能,理解了基础版本再看优化变体会容易很多 训练层面,Cosine LR + AMP 这两个技巧几乎是所有现代训练的标配,在小模型上就能直观感受它们的效果 工程层面,900 万参数的模型可以在免费 GPU 上 5 分钟训练完成,降低了实验的时间和金钱成本到接近零 GuppyLM 的 GitHub 仓库是 arman-bd/guppylm,HuggingFace 数据集是 arman-bd/guppylm-60k-generic,两个 Colab notebook 分别对应训练和使用,打开就能跑 ## 相关链接 - [Jason Zhu](https://x.com/GoSailGlobal) - [@GoSailGlobal](https://x.com/GoSailGlobal) - [arman-bd/guppylm-60k-generic](https://huggingface.co/datasets/arman-bd/guppylm-60k-generic) - [model.py](https://model.py/) - [config.py](https://config.py/) - [model.py](https://model.py/) - [dataset.py](https://dataset.py/) - [train.py](https://train.py/) - [inference.py](https://inference.py/) - [arman-bd/guppylm](https://github.com/arman-bd/guppylm) - [arman-bd/guppylm-60k-generic](https://huggingface.co/datasets/arman-bd/guppylm-60k-generic) - [Upgrade to Premium](https://x.com/i/premium_sign_up) - [10:19 AM · Apr 7, 2026](https://x.com/GoSailGlobal/status/2041339961593708673) - [2,028 Views](https://x.com/GoSailGlobal/status/2041339961593708673/analytics) --- *导出时间: 2026/4/7 21:37:59*
如 如何从零开始构建自己的大语言模型 (LLM) 文章揭秘了 GPT、Claude 等 LLM 背后通用的五阶段构建流程,指出数据质量而非架构才是核心。作者详细阐述了数据清洗、分词、训练目标(预测下一个 Token)及 Transformer 架构实现,并提供了包含 Tokenizer 和 PyTorch 模型的代码示例。 技术 › LLM ✍ Rahul🕐 2026-06-14 LLMTransformer深度学习模型训练分词PythonPyTorch源码解析方法论
P PyTorch 训练流程速查表 这是一份关于 PyTorch 训练流程的单页速查表。文章通过代码示例和原理解析,深入浅出地讲解了张量的核心概念、矩阵乘法、自动求导机制、反向传播以及梯度下降优化过程。同时涵盖了 `nn.Module` 常用组件如 Linear、ReLU 和 GELU 的使用,旨在帮助开发者快速理解深度学习引擎的运作原理。 技术 › 编程语言 ✍ kozue🕐 2026-07-03 PyTorch深度学习教程张量Autograd机器学习速查表矩阵乘法反向传播Python
H How to Build LLM Architectures From Scratch 本文是一篇关于从零构建大型语言模型(LLM)架构的深度指南。文章详细解释了 LLM 的工作原理,包括从原始数据收集、清洗、分词,到 Transformer 架构的核心组件(如自注意力机制、位置编码)。同时涵盖了预训练、微调、基于人类反馈的强化学习(RLHF)以及推理优化等关键技术环节,旨在帮助读者理解 ChatGPT 和 Claude 等模型背后的系统构建全流程。 技术 › LLM ✍ Shabnam Parveen🕐 2026-05-25 LLMTransformer架构设计RLHF深度学习人工智能模型训练OpenAIChatGPT技术原理
2 2026年真正学习AI的7个开源仓库 这是一份2026年AI学习资源清单,包含7个精选的GitHub开源仓库。内容覆盖从初学者指南到高级LLM路线图,包括微软的GenAI课程、从零构建ChatGPT的PyTorch教程、Karpathy的nanoGPT训练、OpenAI与Anthropic的实战Cookbook以及AI Agents构建指南。所有资源均免费,旨在帮助学习者掌握Prompt、RAG、微调及Agent等核心技术。 技术 › LLM ✍ self.dll🕐 2026-05-06 AILLM学习资源GitHubOpenAIClaudeAgent教程开源模型训练
图 图解 Transformer 架构:从原理到细节的全面解析 本文深入浅出地解析了 Transformer 架构,它是现代大语言模型(LLM)的核心。文章从宏观视角出发,通过解码的方式,逐一拆解了 Transformer 的关键组件,包括编码器与解码器、分词与嵌入、位置编码、注意力机制(Attention)以及多头注意力等。作者详细解释了该架构如何解决传统模型的“遗忘”和“慢速”问题,实现了并行处理和长距离依赖捕捉,并最后阐述了其强大的原因。 技术 › LLM ✍ Amit Shekhar🕐 2026-04-18 Transformer架构解析注意力机制深度学习AILLM编码器解码器机器学习教程
如 如何成为一名机器学习工程师:完全指南 本文是一份详细的机器学习(ML)工程师学习路径指南。作者首先纠正了被动观看视频的学习误区,提出“两遍学习法”以建立深刻的技术理解。文章明确了ML工程师与数据科学家及研究员的区别,强调工程实现能力。随后,作者将学习路径分为两个阶段:第一阶段利用 3Blue1Brown 的视频构建数学直觉,涵盖神经网络、梯度下降、反向传播及 Transformer 架构;第二阶段(文中截断处未完)预告将通过 Andrej Karpathy 的课程来提升代码实现能力。 技术 › 机器学习 ✍ Arman Hezarkhani🕐 2026-01-21 机器学习学习路径神经网络Transformer深度学习职业发展LLM3Blue1BrownKarpathy教程
M Math Behind Large Language Model 本文介绍了大语言模型背后的数学原理,涵盖Attention机制、缩放因子、反向传播、梯度下降、交叉熵损失、RoPE位置编码和RMSNorm归一化等核心概念。 技术 › LLM ✍ Amit Shekhar🕐 2026-07-30 LLM数学原理AttentionTransformer机器学习深度学习梯度下降反向传播RoPERMSNorm
关 关于 Inkling 的数学思考 本文从深度流形视角分析 Thinking Machines 的多模态模型 Inkling。探讨了模态早期耦合、放弃 RoPE 的几何意义、Muon 的归一化作用以及大规模强化学习对流形同调的影响,提出了关于数据耦合和训练稳定性的开放问题。 技术 › LLM ✍ deep Manifold🕐 2026-07-22 多模态Inkling流形学习RoPEMuon强化学习深度学习Transformer几何归一化
G GitHub 全网最全使用指南:从入门到榨干 这是一篇面向非程序员的 GitHub 使用指南。文章详细介绍了如何寻找、下载和判断 GitHub 项目,区分源码与安装包,并通过查看 Issues 了解项目真实状况。此外,文章还提供了如何利用 GitHub 发现选题、挖掘用户需求以及寻找商业机会的方法,适合想利用开源项目找工具或变现的普通人。 技术 › 工具与效率 ✍ 诺鸭船长3🕐 2026-07-20 GitHub开源工具教程搜索技巧避坑变现IssuesReleases非程序员
财 财报分析Skill保姆级教程:5分钟装好 文章介绍了GitHub上热门的开源美股分析项目Day1Global-Skills,包含科技股财报深度分析、价值评估等5个工具。作者详细讲解了在Claude、Claude Code和Codex中的安装步骤,提供了实战提示词模板,并分享了在财报季的高效使用流程及注意事项。 技术 › Skill ✍ JinYu金鱼🕐 2026-07-20 ClaudeCodex财报分析美股教程Day1Global-Skills安装指南AI工具投资辅助开源
O OpenRLHF 作者发布 Agentic RL 框架 Molt:9K 行核心代码支持超大规模 MoE 训练 OpenRLHF 作者发布了新的强化学习框架 Molt。该框架采用纯 PyTorch 栈,核心代码仅约 9000 行,专注于 Agentic RL 研究。它支持 Qwen3.5-397B 到 GLM-5.2 753B 等超大规模 MoE 模型训练,无需依赖 Megatron,具备高度的代码可读性和可修改性。 技术 › LLM ✍ 青稞社区🕐 2026-07-16 强化学习Agentic RLMoltPyTorchvLLMMoEOpenRLHF大模型训练深度学习框架
耗 耗时 7 天,我们开源了腾讯 WorkBuddy 实战蓝皮书 作者苍何联合团队经过 7 天努力,正式开源了腾讯 WorkBuddy 实战蓝皮书。该书包含使用手册、实战案例、进阶系统及岗位路线图,旨在填补 WorkBuddy 详细教程的空白,帮助用户通过 AI 提升办公效率。 技术 › Hermes ✍ 苍何🕐 2026-07-13 WorkBuddy实战指南开源AI办公腾讯提效教程案例HermesAgent