📚 Wiki 知识库

🏷️ 模型训练

14 篇

如何教授 AI 模型

文章通过人类学习的类比,通俗易懂地解释了 AI 模型如何学习新技能和行为。它涵盖了从预训练、监督微调到强化学习的三个阶段,以及通过基准测试评估模型和通过模型规范对齐模型行为的重要性,最后指出了当前模型在持续学习方面的局限性。

技术LLM ✍ Lee Robinson🕐 2026-07-24

构建递归智能体系统:扩展 Composer 训练规模

本文介绍了 Cursor 如何构建一个包含数千个 Agent 的递归系统,以加速 Composer 模型的训练。系统通过主 Agent 管理子 Agent 的“健康”状态,实现并行实验的自动化监控与故障修复。该架构将研究员的效能提升了数量级,使大量计算资源能像企业组织一样协同工作。

技术Agent ✍ Lee Robinson🕐 2026-06-14

Step-By-Step LLM Engineering Projects (2026 Edition)

文章提出了一个基于项目的 2026 年 LLM 工程学习路线图。作者主张通过从零构建系统来掌握技术栈,路径涵盖从基础的 Tokenizer、Embedding、Positional Encoding、Attention 机制,到 Transformer 模块构建、训练循环、KV Cache、MoE、量化、服务部署、RAG 及 Agent 等高级系统。该指南强调“实现、绘制、破坏、解释”的学习闭环,旨在帮助读者深入理解大模型原理并具备工程构建能力。

技术LLM ✍ Ahmad🕐 2026-05-25

BestBlogs 早报:AI 编码的工程化深水区

本期早报探讨了 AI 编码从「工具替换」走向「工程化」的范式转变。Cursor 发布 Composer 2.5 并公开训练栈,标志着竞争从应用层下沉到模型层;Anthropic 工程师详解长时 Agent 架构,利用对抗式生成-评估循环将续航提升至 12 小时;阿里云 CIO 则提出应摒弃「AI 生码率」,关注端到端业务价值,指出代码即是负债。文章强调,模型能力、Agent 架构与组织效能三者结合,才能实现从写得快到做得对的跨越。

技术DevOps ✍ ginobefun🕐 2026-05-19

SkillOS 详解:自进化 Agent 的技能策展机制

文章详细解读了 Google 关于 SkillOS 的最新论文。SkillOS 是一个帮助 LLM Agent 通过管理可复用“技能”来实现自我进化的框架。该框架包含一个冻结的 Agent Executor 和一个可训练的 Skill Curator,后者利用强化学习(RL)从执行轨迹中自动提取、更新或删除技能,从而实现从经验到技能的转化。

技术Agent ✍ AVB🕐 2026-05-12

2026年真正学习AI的7个开源仓库

这是一份2026年AI学习资源清单,包含7个精选的GitHub开源仓库。内容覆盖从初学者指南到高级LLM路线图,包括微软的GenAI课程、从零构建ChatGPT的PyTorch教程、Karpathy的nanoGPT训练、OpenAI与Anthropic的实战Cookbook以及AI Agents构建指南。所有资源均免费,旨在帮助学习者掌握Prompt、RAG、微调及Agent等核心技术。

技术LLM ✍ self.dll🕐 2026-05-06

Model-Harness-Fit: 模型与协作框架的深度适配

本文深入探讨了“Model-Harness-Fit”(模型与协作框架的适配)这一概念。作者通过对比 Codex、Claude Code 和 GitHub Copilot SDK,指出模型在训练后与特定的工具界面、内存协议和规划机制深度绑定。仅更换模型而保留通用框架会导致性能显著下降。文章强调,模型本身的权重不再是唯一的护城河,与其配套的整个工程堆栈才是关键。

技术Harness Engineering ✍ Nicolas Bustamante🕐 2026-05-04

顶级AI实验室如何构建RL智能体:从RLHF到RULER的演进

文章探讨了 Anthropic、OpenAI 和 DeepSeek 等顶尖 AI 实验室在 2026 年关于强化学习(RL)的趋同思路,即使用系统提示作为奖励函数。内容详细梳理了 RL 在 LLM 中的应用历程,从 RLHF 到 RULER(Karpathy 提出的系统提示学习概念)的演变。重点介绍了 DeepSeek R1 利用可验证奖励(RLVR)突破传统瓶颈的机制,通过规则编译器直接提供信号,并结合 GRPO 算法移除了复杂的 Critic 和奖励模型,实现了从 15.6% 到 77.9% 的 AIME 数学成绩飞跃。

技术LLM ✍ Avi Chawla🕐 2026-04-28

900万参数,130行代码:从零构建微型语言模型 GuppyLM 教程

本文介绍了开发者 arman-bd 开源的微型语言模型 GuppyLM。该模型拥有 900 万参数,核心代码仅 130 行,可在免费 Colab 上 5 分钟训练完成。文章详细拆解了构建流程:利用模板生成 6 万条合成数据、训练 4096 词表的 BPE 分词器、搭建 6 层 Vanilla Transformer 架构以及优化推理环节。该项目旨在通过极简的实现,帮助开发者深入理解语言模型的数据工程、架构设计与训练循环。

技术LLM ✍ Jason Zhu🕐 2026-04-07

100 小时深入基米:揭秘 Moonshot AI 的极客文化与生存法则

本文通过100小时的内部观察,深入剖析了Moonshot AI(Kimi)独特的企业文化与生存状态。文章记录了公司如何在DeepSeek崛起的压力下调整战略,强调了“模型能力”至上的原则。作者揭示了该公司偏爱具有“概括能力”和“品味”的天才型员工,实行无KPI、无层级的扁平化管理,并详细描述了年轻员工在高强度跨领域工作中的成长与焦虑。这不仅是一家初创公司的生存侧写,也是对AI时代人才组织模式的深刻探讨。

技术LLM ✍ Rui Ma🕐 2026-04-01