Math Behind Large Language Model
本文介绍了大语言模型背后的数学原理,涵盖Attention机制、缩放因子、反向传播、梯度下降、交叉熵损失、RoPE位置编码和RMSNorm归一化等核心概念。
本文介绍了大语言模型背后的数学原理,涵盖Attention机制、缩放因子、反向传播、梯度下降、交叉熵损失、RoPE位置编码和RMSNorm归一化等核心概念。
文章通过分析2026年菲尔兹奖得主邓煜关于硬球动力学与玻尔兹曼方程的数学工作,探讨了人工智能的数学本质。文章指出,AI的核心能力在于在没有已知全局方程的情况下进行可学习数值计算,并强调AI的宏观能力源于局部数学结构的长期演化与闭合,而非单纯规模扩张。
文章回顾了强化学习七十年跌宕起伏的发展历程。从心理学的效果律与数学的动态规划这两条根源讲起,梳理了教科书时期的理论奠基与早期边缘化。随后,深度学习的引爆带来了黄金年代,DQN与AlphaGo的辉煌让强化学习备受推崇。然而,样本效率等缺陷曾让其一度跌入谷底。如今,这门学科在大模型时代通过RLHF等技术奇迹般重生,再次站到了AI舞台的中央。
本文从深度流形视角分析 Thinking Machines 的多模态模型 Inkling。探讨了模态早期耦合、放弃 RoPE 的几何意义、Muon 的归一化作用以及大规模强化学习对流形同调的影响,提出了关于数据耦合和训练稳定性的开放问题。
本文详细介绍了月之暗面发布的 Kimi K3 模型。该模型拥有 2.8 万亿参数和 100 万 token 上下文,性能超越 Claude Opus 4.8 和 GPT-5.6 Sol,对标 Fable 5。文章分析了其定价策略、架构创新以及模型自主优化架构的能力,展示了其在长程编码和 3D 前端开发方面的强大实力。
OpenRLHF 作者发布了新的强化学习框架 Molt。该框架采用纯 PyTorch 栈,核心代码仅约 9000 行,专注于 Agentic RL 研究。它支持 Qwen3.5-397B 到 GLM-5.2 753B 等超大规模 MoE 模型训练,无需依赖 Megatron,具备高度的代码可读性和可修改性。
文章深入浅出地讲解了信息论的起源、核心概念及其与人工智能的关系。内容涵盖香农在1948年奠定的信息论基础(如熵、比特、信道容量定理),回顾了奈奎斯特、哈特利及玻尔兹曼等前人的贡献,并探讨了交叉熵、KL散度等概念如何成为衡量AI模型误差的关键工具。文章指出,尽管信息论为AI提供了度量语言,但在解释智能本质上仍有局限。
本文深入探讨了AI可解释性的必要性、定义及核心方法。文章区分了调试、合规与安全三种不同需求,辨析了事前与事后、局部与全局解释的差异,重点介绍了从LIME/SHAP等经典归因法到大模型时代的机制可解释性(如SAE和电路分析)的演进,并强调“忠实性”优于“可读性”的核心原则。
作者从智能发展的角度,深入探讨了算法进步、AI自我迭代(RSI)、算力瓶颈与摩尔定律、以及开源与闭源实验室的竞争态势。文章认为,我们正处于早期起飞阶段,算法效率的提升空间巨大,AI将自动化科研,导致技术奇点来得比预期更快。
这是一份按主题编排的AI领域人物小传(上篇),涵盖了从深度学习奠基者、大模型实验室领袖、Transformer论文作者到顶尖学术研究者的75位关键人物。文章详细介绍了每个人的背景、核心贡献及当前动态,包括Hinton、LeCun、Altman等业界巨擘。
这是一份关于 PyTorch 训练流程的单页速查表。文章通过代码示例和原理解析,深入浅出地讲解了张量的核心概念、矩阵乘法、自动求导机制、反向传播以及梯度下降优化过程。同时涵盖了 `nn.Module` 常用组件如 Linear、ReLU 和 GELU 的使用,旨在帮助开发者快速理解深度学习引擎的运作原理。
本文反对直接使用 AI 总结全书,指出这会导致理解外包和记忆流失。作者提出以“章”为单位的陪读方法,利用 Codex 生成读前问题、评估复述盲点、设计应用场景并生成章节卡片。该方法强调主动回忆与自我解释,将 AI 作为反馈工具而非替身,旨在通过最小闭环实现深度阅读。
文章深入解析了具身智能的定义、历史渊源及发展现状。作者区分了具身智能与传统机器人,指出其核心在于感知-行动闭环与物理世界的实时交互。文章回顾了从符号主义、行为主义到深度学习、Transformer时代的技术演进,分析了VLA模型如何继承大模型能力来突破泛化难题,探讨其与AI的本质关系及未来前景。
文章揭秘了 GPT、Claude 等 LLM 背后通用的五阶段构建流程,指出数据质量而非架构才是核心。作者详细阐述了数据清洗、分词、训练目标(预测下一个 Token)及 Transformer 架构实现,并提供了包含 Tokenizer 和 PyTorch 模型的代码示例。
文章探讨了物理学与人工智能(特别是深度学习)之间的深刻联系。作者指出,神经网络本质上是一个类似于物理学中的“多体系统”,因此统计力学的语言天然适用于描述AI。文章详细拆解了能量最小化、Softmax(玻尔兹曼分布)、交叉熵(信息熵)、VAE(自由能)以及最大熵原理等核心AI概念背后的物理学渊源,揭示了从蒸汽机到神经网络的知识传承。
本文是《当物理遇上AI》的下篇,探讨了深度学习中的未解难题与物理学现象的同构关系。作者详细分析了Scaling Law与临界标度律、模型涌现与相变、双下降曲线与随机矩阵理论之间的深层联系。文章评估了这些类比证据的强弱,指出部分物理数学工具已能精确推导AI行为,同时也讨论了争议与未解之谜。
本文详细介绍了AI图像与视频生成背后的核心技术——扩散模型(Diffusion Model)。文章通过通俗易懂的语言,解释了其物理起源、从加噪到去噪的运作原理,以及它如何凭借稳定性优势逐渐取代GAN成为生成式AI的主流范式。
本文翻译整理了一组在 X 上广为流传的 AI 科普手绘图,涵盖从神经网络、Transformer 架构到大语言模型(LLM)的 20 个核心概念。作者不仅解释了 AI 底层运作原理(如分词、注意力机制),还介绍了模型优化手段(如微调、RLHF)及前沿应用架构(如 RAG、Agent、思维链),是一份简洁全面的 AI 技术入门指南。
本文为 AI 初学者提供了一份为期 14 周的实战路线图,旨在通过免费资源将新手培养成具备构建生产级 AI 系统能力的工程师。路线图包含六个阶段:环境搭建、AI 基础、机器学习基础、深度学习、现代 LLM 工程以及 Agent 与部署。文章强调动手实践,推荐了 OpenAI、Anthropic 官方教程及 GitHub 优质开源仓库,帮助学习者避开盲目刷证书的误区,真正掌握 AI 开发技能。
本文提供了一个为期14周的实战型AI工程师学习路线图,旨在解决初学者“只学不做”的困境。文章从环境搭建开始,详细列出了从AI基础、机器学习、深度学习到现代LLM工程及Agent开发的最佳免费资源(如OpenAI/Anthropic官方课程、Karpathy的教程等)。路线强调通过GitHub项目实践来理解原理,最终掌握部署与评估技能,真正从零开始构建可用的AI系统。
文章详细介绍了 LoRA (Low-Rank Adaptation) 技术,这是一种用于高效微调大型语言模型的方法。通过冻结原始权重并学习两个极小的低秩矩阵,LoRA 能够在保持模型性能的同时,大幅降低显存占用、训练成本和存储空间。文章还解释了 LoRA 的核心数学原理、具体实施步骤以及为何全量微调成本高昂的原因。
文章深入探讨了混合专家模型(MoE),这是一种通过激活特定子网络来高效扩展 AI 模型的架构策略。文章回顾了 MoE 的历史背景,详细解释了其由门控网络和专家组成的结构及稀疏路由机制,并分析了其在 Transformer 中的应用、优势(如高效计算、参数扩展)以及面临的负载平衡和通信开销等挑战。
文章深入探讨了如何利用神经网络构建量化交易系统。作者解释了对冲基金如何利用机器学习提取交易优势,揭示了神经网络计算条件期望的数学本质,而非直接预测未来。文中分析了为何直接预测价格会失败,并提出了正确的数据处理方法和架构选择,旨在为交易者提供一个从数据准备到信号部署的完整实施框架。
本文探讨了科技巨头如 NVIDIA、Meta 和 Microsoft 正在秘密研发的状态空间模型(SSM),旨在解决 Transformer 架构在长序列处理中的计算和内存瓶颈。文章详细介绍了 SSM 的线性复杂度优势,并列举了 NVIDIA Nemotron-H 和 IBM Bamba-9B 等混合模型如何通过替换 Attention 层来提升推理速度和降低内存消耗。此外,文中还回顾了 S4 和 Mamba 等 SSM 架构的演变,展示了 SSM 在大模型未来的巨大潜力。
文章介绍了一种高效使用 NotebookLM 的方法。不同于传统的总结或做卡片,这种方法将其视为苏格拉底导师和研究顾问。核心流程包括:上传 20 个跨领域的源资料以构建课程;利用费曼技巧通过对话修正理解;寻找源资料中的矛盾点以培养批判性思维;以及通过模拟教学和每周综合来巩固知识,最终实现跨学科的通才思考。
本文深入探讨了人工智能领域热门概念“世界模型”。文章指出世界模型是一个问题陈述而非特定架构,类似于SLAM。文章通过自动驾驶案例阐述了Yann LeCun的形式化定义(状态预测与渲染分离),并对比了当前三种主流范式:生成式模型(如Sora)、潜在动力学模型(如Dreamer)以及JEPA架构,分析了它们在压缩策略和预测目标上的差异。
本文深入探讨了模型后训练中的 SFT 与 RL 流程,重点分析了基于同族模型(Same-family)的 On-Policy 蒸馏(OPD)技术。文章解释了 SFT 存在性能天花板的原因,以及 RL 如何通过复利效应突破这一限制。作者指出 OPD 结合了 SFT 的低成本和 RL 的复合优势,能高效利用教师模型的反向 KL 散度信号,是实现高性能模型微调的关键手段。
文章指出大多数人仅使用了 Claude 10% 的功能,仅停留在问答和摘要层面。作者分享了 20 个提示词,旨在将 Claude 转变为私人健身教练、谈判专家、财务分析师等角色。文中详细介绍了深度研究(如多源综合、魔鬼代言人模式)和写作辅助(如风格模仿、残酷编辑)等具体场景的 Prompt,通过高质量指令挖掘 AI 潜能,将其提升为真正的生活与工作助手。
文章从OpenAI关停Sora切入,深入探讨了Sora核心架构DiT创造者谢赛宁对大语言模型(LLM)的根本性质疑。谢赛宁认为LLM只是在模仿语言的统计规律,而非理解世界,语言是“鸦片”。文章详细阐述了基于抽象表征空间的预测架构(JEPA)和世界模型才是通往通用智能的正确路径,并指出未来的AI架构中,LLM将退化为仅用于交流的界面,而表征层才是真正的基石。
本文旨在消除从事 AI/ML 工作对数学博士学位的恐惧,提供了一份精准的线性代数学习路线图。文章分为五个阶段:从标量、向量、矩阵等基础概念,到特征值、SVD(奇异值分解)等核心机器学习数学工具,再到连接微积分的梯度与雅可比矩阵。作者强调了掌握这些概念对于理解神经网络、PCA、推荐系统及 LoRA 微调等技术的重要性。
文章介绍了 LeWorldModel (LeWM),一种新的世界模型架构。它解决了当前世界模型(如 DINO-WM 和 PLDM)的局限,仅通过两个损失项(Next-embedding 预测损失和 SIGReg)实现了从原始像素开始的稳定端到端训练。实验表明,LeWM 能在潜在空间中自发涌现出时间直线性和物理约束,有效避免了表示偏差和模型崩塌问题。
文章基于作者在 ByteDance Seed 的研究经历,探讨了 Looped LLM 架构的起源与演进。作者通过分析 Anthropic 发布的 Claude Mythos 在 GraphWalk BFS 基准上的异常表现,指出 Looped 架构在多跳推理和状态追踪上的优势。文章进一步深入讨论了 Looped LLM 在扩展至 10T/100T 规模时面临的深度稳定性、推理效率和 FLOPs 有效性的三大挑战,并对比了 RNN 视角与 Parallel Looped Transformer 等解决方案。
这是一份针对计算机科学和数学专业大二学生的机器学习(ML)与强化学习(RL)入门阅读清单。清单分为四个部分:基础(如ResNet、Attention)、AI基础设施(如VAE、BERT、LoRA、Agent)、推理加速(如Linear Attention、Speculative Decoding)以及强化学习(如PPO、DPO、RLHF)。该列表由导师 Mingyang Yi 推荐,旨在帮助本科生构建系统的 AI 知识体系。
本文深入浅出地解析了 Transformer 架构,它是现代大语言模型(LLM)的核心。文章从宏观视角出发,通过解码的方式,逐一拆解了 Transformer 的关键组件,包括编码器与解码器、分词与嵌入、位置编码、注意力机制(Attention)以及多头注意力等。作者详细解释了该架构如何解决传统模型的“遗忘”和“慢速”问题,实现了并行处理和长距离依赖捕捉,并最后阐述了其强大的原因。
文章列出了每位 LLM 工程师必须阅读的 12 篇核心论文清单,涵盖了从 Transformer 架构、BERT、GPT-3 等基础模型,到扩展定律、Chinchilla 训练法则、RLHF 对齐技术,以及 LoRA 高效微调和 FlashAttention 等工程优化技术。这些论文构成了现代大模型理解、训练和部署的理论基石。
本文深入剖析了信息时代下的「伪学习」困境,指出人类大脑进化滞后于技术发展导致认知效率下降。文章结合神经科学原理,揭示了多任务处理、碎片化信息和即时反馈对大脑记忆机制的损害,并提出了利用「无聊」激活默认模式网络(DMN)的价值。作者提供了一套包含认知节律建立、环境断舍离及深度加工技术的系统性重构方案,旨在帮助读者从信息过载中夺回注意力,实现深度学习。
本文介绍了开发者 arman-bd 开源的微型语言模型 GuppyLM。该模型拥有 900 万参数,核心代码仅 130 行,可在免费 Colab 上 5 分钟训练完成。文章详细拆解了构建流程:利用模板生成 6 万条合成数据、训练 4096 词表的 BPE 分词器、搭建 6 层 Vanilla Transformer 架构以及优化推理环节。该项目旨在通过极简的实现,帮助开发者深入理解语言模型的数据工程、架构设计与训练循环。
本文是一篇基于工程视角的AI技术硬核解析,旨在厘清从LLM大模型到Agent智能体的核心概念体系。文章深入浅出地拆解了LLM的文字接龙本质、Tokenizer的翻译机制、上下文窗口的容量限制,以及Prompt工程、MCP工具协议和Agent技能的运作原理,帮助读者建立完整的底层技术认知。
本文是一篇硬核技术教程,详细记录了如何不依赖任何外部库,仅使用纯 C 语言从零构建一个可用的 GPT(Generative Pre-trained Transformer)模型。文章涵盖了从随机数生成、数据分词、模型架构定义,到手动实现反向传播、Adam 优化器及推理采样的全过程。通过手写矩阵乘法、注意力机制和神经网络层,帮助读者深入理解 LLM 的底层原理。
本文是一份详细的机器学习(ML)工程师学习路径指南。作者首先纠正了被动观看视频的学习误区,提出“两遍学习法”以建立深刻的技术理解。文章明确了ML工程师与数据科学家及研究员的区别,强调工程实现能力。随后,作者将学习路径分为两个阶段:第一阶段利用 3Blue1Brown 的视频构建数学直觉,涵盖神经网络、梯度下降、反向传播及 Transformer 架构;第二阶段(文中截断处未完)预告将通过 Andrej Karpathy 的课程来提升代码实现能力。
本文是对 2025 年大语言模型(LLM)领域发展的深度回顾。主要趋势包括:推理模型的普及(OpenAI o 系列)、Agent 和编码 Agent 的爆发式落地(特别是 Claude Code)、中国开源模型在排行榜上占据主导地位、长任务处理能力的翻倍增长、Google Gemini 的全面崛起以及 OpenAI 领先优势的缩小。此外,文章还涵盖了图像编辑、学术竞赛表现、模型安全与“告密”现象等热点话题,指出 2025 年是 AI 实用化和工具化的一年。
本文列举了斯坦福大学关于人工智能与机器学习的 10 门顶级课程,涵盖了人工智能基础、机器学习、深度学习、强化学习、自然语言处理(NLP)、计算机视觉(CV)、大语言模型(LLMs)及深度生成模型等核心领域,旨在帮助学习者掌握 AI 第一性原理。
本文档详细阐述了一款骨科手术导航与规划系统的开发目的、应用场景及技术栈。该系统旨在通过三维骨骼模型重建与实时导航,提高骨科手术精准度。项目采用C++、Python、C#多语言开发,涉及OpenCV、VTK、TensorFlow等技术,源代码量约40万至60万行,涵盖影像处理、AI识别及高性能可视化等核心功能。