当物理遇上AI:深度学习里的物理元素(上) ✍ snowboat🕐 2026-06-05📦 63.4 KB 🟢 已读 𝕏 文章列表 文章探讨了物理学与人工智能(特别是深度学习)之间的深刻联系。作者指出,神经网络本质上是一个类似于物理学中的“多体系统”,因此统计力学的语言天然适用于描述AI。文章详细拆解了能量最小化、Softmax(玻尔兹曼分布)、交叉熵(信息熵)、VAE(自由能)以及最大熵原理等核心AI概念背后的物理学渊源,揭示了从蒸汽机到神经网络的知识传承。 深度学习物理学统计力学神经网络熵Softmax交叉熵自由能机器学习方法论 # 当物理遇上AI:深度学习里的物理元素(上) **作者**: snowboat **日期**: 2026-05-28T23:45:46.000Z **来源**: [https://x.com/snowboat84/status/2060145538922844179](https://x.com/snowboat84/status/2060145538922844179) ---  # 引子 2024年10月的某一周,两件事接连发生。10月8日,诺贝尔物理学奖给了霍普菲尔德(John Hopfield)和辛顿(Geoffrey Hinton),表彰"为利用人工神经网络进行机器学习奠定的基础性发现和发明"。第二天10月9日,诺贝尔化学奖给了三个人,一半给贝克(David Baker)的蛋白质从头设计,另一半给哈萨比斯(Demis Hassabis)和江珀(John Jumper)的AlphaFold。  John Hopfield & Geoffrey Hinton  David Baker, Demis Hassabis, and John Jumper at 2024 Nobel Prize 一周内两个AI工作连领自然科学界最高奖。这是1901年诺奖开评以来从没出现过的画面,更超现实的是,它把瑞典皇家科学院公开认定为"物理学"和"化学"的工作,奖给了两支并不属于传统物理学或化学界的团队。 这里就产生了一个大问题:物理和AI,看上去隔着几个世纪的两件事,渊源到底有多深? 这一篇就是来讨论这个问题:当物理遇上AI。我们先讲讲为什么物理学的语言天然适合描述神经网络,然后逐一拆开AI的核心构件,看每件背后站着哪些物理学的魂灵,它们怎么从十九世纪走进二十一世纪今天的神经网络。 # 一、为什么是物理学:神经网络是一个"多体系统" 要回答"物理学为什么能进入AI",得先看物理学独有什么。 大多数学科都有一个看得清的主角。数学研究结构本身,化学研究分子,生物学研究细胞,经济学研究人。物理学在十九世纪之前也有清晰主角,牛顿研究天体怎么动,麦克斯韦研究电磁场怎么传播,研究对象都是少数几个清晰的客体。 但十九世纪中后期物理学被迫面对一个之前所有学科都绕开的问题:当一个系统是由海量个体组成,个体之间还互相作用,怎么谈论它?一杯水(约 250 毫升)里有大约 8 × 10²⁴ 个水分子(Avogadro 常数 6 × 10²³ 只是 18 毫升水里的分子数),没法逐个追踪它们的位置和速度。但这杯水会结冰、会沸腾、有温度、有压强。这些宏观性质必须存在某种描述方式,跟单分子追踪无关。 物理学被这个问题逼出了一门独有的功夫,叫做统计力学。这套理论的核心做法是:放弃追踪个体,只追踪整体的概率分布。放弃微观信息的完整保留,承认信息损失的不可避免。用温度、熵、自由能这些只在"海量个体集合"层面有意义的量,去描述系统的集体行为。 这套语言别处没有。数学不研究海量个体,化学的"海量"通常限于一种反应,生物学的"海量"是层级化的(细胞、组织、器官)而不是同质的。只有物理学,从玻尔兹曼到吉布斯到现代凝聚态物理,系统化地建立了一整套谈论海量同质个体集体行为的语言。 神经网络恰好就是这样一个系统。一个GPT-4级别的模型有大约一万亿参数,单看一个参数什么都不是。但合起来,它涌现出识别、生成、推理的能力。每个参数和别的参数都通过激活函数和反向传播间接耦合,整个网络是一个高维度的耦合系统。 这跟物理学家一辈子研究的对象惊人地像。第一次看神经网络内部的物理学家,看到的是熟悉的多体系统换了身衣服。神经元的权重像自旋之间的耦合,损失函数像系统的能量,训练像系统从高能态滚向低能态。这套对应深到底层数学结构的同构,远远超出表面相似的程度。 于是物理学那套语言天然能照进AI,这是同类系统呼唤同一套语言的结果。下一章开始,我们逐一拆开AI的核心构件,看物理学语言怎么具体地进入了每一件。  # 二、神经网络的底层模型:能量、熵与自由能 这一章讲AI模型的底层骨架。这里物理学不仅贡献了大量使用经验和直觉,还贡献了一批专属概念(熵、自由能、温度、最大熵原理)。物理学家看这些概念,看到的全是老朋友。 ## 2.1 一个统一的视角:能量 物理学最根本的世界观是:万物都在滚向能量最低处。水往低处流,球滚谷底,磁铁的指南针稳定在南北朝向,这些都是同一回事,系统在找它自己的能量极小点。 这个视角在物理学里被用了三个世纪。1657 年费马(Pierre de Fermat)证明光线总走"耗时最短"的路径,第一次把"最小化某个量"作为一条物理定律。1744 年莫培督(Pierre Maupertuis)把这个思想推广成"最小作用量原理"。1788 年拉格朗日(Joseph-Louis Lagrange)出版《分析力学》(Mécanique Analytique),用变分法把牛顿力学整套重写,得到了今天物理系本科生必学的拉格朗日方程。半个世纪后哈密顿(William Hamilton)1834 年又把这套语言推广成哈密顿原理和哈密顿力学,"能量"和"作用量"从此成了描述物理系统的两个最核心的概念。 1915 年爱因斯坦写下广义相对论的时候,他和数学家希尔伯特(David Hilbert)几乎同时发现了 Einstein-Hilbert 作用量,整个广义相对论可以从一个变分原理推出来。1948 年费曼(Richard Feynman)发明的量子力学路径积分公式,把整个量子力学重写成"在所有可能路径中按作用量加权求和"。再往后的量子场论、杨-米尔斯规范场论、标准模型、弦论,每一个新理论第一件事都是写下它的"作用量"然后求变分。 从经典力学到量子场论这三百年,能量最小化(或者更一般的作用量极值化)都是物理学描述系统行为的总框架。 这个框架被原封不动地搬给了AI。神经网络的训练叫"最小化损失函数",损失函数就是能量的另一个名字。一个网络从随机权重开始,每次反向传播都把权重往"能量更低"的方向推一小步,直到滚到一个局部低谷。后面所有的概念(损失函数、能量模型、Hopfield网络),都是这个总框架的不同分身。 物理学送给AI的第一份大礼,就是"用能量描述系统、再让它最小化"这套总框架。 ## 2.2 Softmax:玻尔兹曼住进了神经网络 神经网络里有很多激活函数(ReLU、Sigmoid、Tanh等等),但Softmax在所有"把模型判断变成概率"的场合都是独家垄断。分类任务的输出层是Softmax,语言模型预测下一个词是Softmax,Transformer的注意力机制核心步骤也是Softmax。 它的数学形式很简单。给定 n 个分数 z₁, z₂, ..., zₙ,Softmax 把它们变成 n 个加起来等于 1 的概率:P(i) = exp(zᵢ) / Σⱼ exp(zⱼ)。 这个形式十九世纪物理学里就出现过,叫玻尔兹曼分布。 玻尔兹曼是奥地利物理学家,1872 年发表了一篇题为《气体分子热平衡的进一步研究》的论文,提出了著名的 H 定理和能量在气体分子里的分配公式。他要回答的问题是:一杯气体里成千上万亿个分子,能量怎么分配在它们身上?答案是,处于能量 E 的分子的概率正比于 exp(-E/kT),T 是温度,k 是后来以他命名的玻尔兹曼常数。  玻尔兹曼(1844-1906) 把这个公式跟Softmax对比,形式完全一致。如果把神经网络输出的"分数" zᵢ 看成 -Eᵢ(负能量),Softmax就是温度等于1的玻尔兹曼分布。每一次GPT吐出下一个词,它内部都在算几万个候选词的分数,然后用Softmax(也就是玻尔兹曼分布)把分数变成概率再抽样。玻尔兹曼1872年研究气体分子时绝不会想到,他这个公式一个半世纪后会被每秒钟调用几十亿次。 吉布斯(Josiah Willard Gibbs)是美国物理学家,1902年出版的《统计力学原理》把玻尔兹曼的工作推广成了统计力学的一般框架,今天我们叫这个分布Boltzmann-Gibbs分布。  Josiah Willard Gibbs 物理是这样注入AI的底层模型的:玻尔兹曼的气体分子 → 吉布斯的一般化框架 → 1985年辛顿、Sejnowski、Ackley三人合作的玻尔兹曼机把它搬进神经网络 → 今天每个大模型每秒钟几十亿次调用。 玻尔兹曼分布之所以在物理学里出现,是因为它是"在给定平均能量这个约束下熵最大"的分布。能量相同的微观状态被认为概率相等,能量越高的状态概率指数级压低,整体上是"基于已知能量约束做出的最不偏不倚的分配"。这个性质让 Softmax 在 AI 里成了一个标准工具:当模型在"我不确定下一个词是哪个,但每个候选的分数我能算出来"的时候,Softmax 给出的就是基于这些分数最不偏不倚的概率分布。 要排 AI 底层算子的重要性,前面还有矩阵乘法、ReLU、反向传播、attention,Softmax 排不进这一档。但凡是要做"分数变概率"的地方,它都是默认选择。 ## 2.3 损失函数里的熵:从蒸汽机流到大模型 主流神经网络训练就是让损失(loss)变小(强化学习是个例外,它最大化奖励,GAN 走的是 minimax 博弈)。在分类任务和语言模型里,最常用的损失叫"交叉熵"(cross entropy),核心字是"熵"。回归任务用 MSE,自监督学习用 contrastive loss / InfoNCE,扩散模型用 score matching,每一类都有自己的标准损失,交叉熵不是唯一的王。 熵这个词诞生于十九世纪工业革命的实验室,比AI早一百五十年。 德国物理学家克劳修斯(Rudolf Clausius)1865年研究热力学第二定律时,造了"entropy"(熵)这个词,词根来自希腊语"τροπή"(转变)。他给的定义偏宏观和热力学:在一个孤立系统里,熵总是增加,这就是著名的热力学第二定律。一杯热水放在桌上会变凉,凉水不会自发变热,这就是熵增。  Rudolf Clausius 玻尔兹曼接着给了熵一个微观解释。他证明熵正比于"系统在微观上可能的状态数的对数",写成公式就是S = k log W。这个公式刻在他维也纳中央公墓的墓碑上,是物理学最有名的几个公式之一。这个微观解释意味着熵本质上是一种"无知度",系统的微观状态数越多,我们对系统的微观信息越无知,熵越大。 剧情转折发生在1948年。贝尔实验室的香农(Claude Shannon)发表了《通信的数学理论》,把通信问题数学化,要找一个量来衡量"消息的不确定性"。他算出来的公式形式是H = -Σ pᵢ log pᵢ。  Claude Shannon 这个公式他想叫"不确定性度量"。冯·诺依曼(John von Neumann)建议他直接叫"entropy"(熵)。冯·诺依曼给的理由听起来像在开玩笑但被一字不漏地引用了大半个世纪:"你应该叫它熵,理由有两个。第一,这个不确定性函数在统计力学里早就以这个名字存在了。第二,更重要的是,没人真正知道熵到底是什么,所以辩论的时候你永远占上风。" 香农采纳了这个建议。从此"熵"同时活在物理学和信息论两个学科里,公式一模一样,只是物理学版本前面有个玻尔兹曼常数k。 到了机器学习时代,熵进入了损失函数。分类任务用交叉熵衡量"模型预测的分布和真实分布之间的差距",语言模型训练时算的"困惑度"(perplexity)本质就是熵的指数。 所以一行Python代码 loss = -torch.sum(y * torch.log(p_pred)),追到根,是克劳修斯1865年研究蒸汽机时造的词、玻尔兹曼1877年给的微观解释、香农1948年借给了信息论、然后又被信息论借给了今天的PyTorch。 ## 2.4 自由能:VAE 的灵魂 生成模型VAE(Variational Autoencoder)2013年由Kingma和Welling提出,是今天扩散模型之前的主流生成模型架构之一。VAE训练时优化的目标函数叫ELBO(Evidence Lower Bound,证据下界)。  Variational Autoencoder ELBO的数学形式,跟物理学里的"变分自由能"完全一致。 "自由能"是十九世纪热力学的核心概念。亥姆霍兹(Hermann von Helmholtz)和吉布斯各自独立地引入了它的不同形式,吉布斯自由能G = H - TS(焓减温度乘熵),亥姆霍兹自由能F = U - TS(内能减温度乘熵)。物理学要回答的问题是:一个体系处在某个温度下,它的"实际可用能量"是多少?答案是总能量减去被熵消耗掉的那部分。  Hermann von Helmholtz 这个F = U - TS的结构非常有用。一个化学反应能不能自发进行,判断标准是反应能不能让自由能下降,跟反应放不放热没有直接关系。所以自由能在化学和物理里是判断系统平衡和反应方向的总裁。 VAE的ELBO在数学上写出来是 ELBO = E[log p(x|z)] - KL(q(z|x) || p(z)),第一项是重构误差(模型重建原始数据的能力),第二项是KL散度(潜变量分布跟先验分布的偏离)。 物理学家看这个式子,看到的就是F = U - TS。重构误差对应"能量"项,KL散度对应"熵"项。VAE训练就是在最小化变分自由能。 不仅VAE,整个变分推断(variational inference)领域,本质都是把物理学的自由能最小化搬进机器学习。弗里斯顿(Karl Friston)在脑科学里推的"自由能原理"更进一步,主张整个大脑的运作机制都可以用"最小化自由能"来统一解释。这个理论争议很大,但至少在数学语言这一层,物理学的自由能已经成了AI和神经科学共用的工具。 VAE在2015到2020年间是生成图像的主流方法,后来被GAN和扩散模型分走了大量市场。但变分推断作为一种通用框架,活在今天几乎所有的概率图模型里。一个用PyTorch写贝叶斯神经网络的工程师,每天都在最小化一个不知不觉就是"自由能"的损失。 ## 2.5 最大熵:连接物理与推断的枢纽 前面 2.2 节顺手提过一句"玻尔兹曼分布是约束下熵最大的分布"。这件事是有完整数学证明和深刻哲学含义的,1957 年 5 月美国物理学家杰恩斯(E. T. Jaynes)在《Physical Review》发表《信息论与统计力学》(Information Theory and Statistical Mechanics)把它系统化讲清楚,正式提出"最大熵原理"。  E. T. Jaynes 统计力学这套理论,本质是一种统计推断,它的工作机制是"在已知的约束下做最大熵推断"。物理学的"平衡态"和统计学的"无偏估计"是同一件事的两种说法。物理学家几十年来在算的"系统达到平衡时温度怎么分布、能量怎么分配",跟统计学家在算的"在给定边际分布的情况下最不偏不倚的联合分布是什么",数学上完全等价。 最大熵原理今天在机器学习里很活跃。逻辑回归(logistic regression)是最大熵分类器,自然语言处理里的最大熵模型曾是序列标注的主力工具,强化学习里的最大熵策略(maximum entropy reinforcement learning)是 SAC 这类算法的核心。Softmax 之所以普适,根本原因也在这里:它是"基于已知分数的最不偏不倚的概率分布"。 但最大熵真正重要的角色是哲学性的。它把物理的"熵"和统计的"推断"焊在了一起,让两个看上去无关的学科共享同一套数学语言。前面 2.2 / 2.3 / 2.4 三节讲的玻尔兹曼分布、交叉熵、自由能能跨过物理与 AI 的边界,根子上都是因为有这条枢纽。 ## 2.6 优化与梯度下降:物理学借给优化的几样工具 训练神经网络靠梯度下降,沿着损失函数下降最快的方向挪一小步。物理学家爱用"球滚下山"来描述梯度下降,因为这跟物体在势能场里运动的图像一模一样。 但这里要诚实一句:梯度下降本身不是物理发明的。 法国数学家柯西(Augustin-Louis Cauchy)1847 年提出了梯度下降法,原本是为了求解大型方程组。他的办法是把"求方程的解"转化为"求一个函数的极小值点",再用迭代的方式一步步逼近。最小二乘法的另一条根则在 1809 年高斯(Carl Friedrich Gauss)的天体测量误差理论里。这些是纯数学和数值计算的工具。 但物理学在"怎么更好地下降"这件事上,借给优化领域一大批具体技术,每一项今天都还在 AI 训练里活跃。 模拟退火。这套方法直接借自冶金学:金属冷却得太快会留下大量缺陷,慢慢退火可以让原子有机会找到能量更低的排列。1983 年 IBM 研究院的 Kirkpatrick 把这套思路搬成了一种优化算法,先把"温度"调高让系统能跳出局部极小,再慢慢降温收敛到全局极小。今天它仍是组合优化(旅行商问题、芯片布局、调度)的标准武器,深度学习训练里的"学习率调度"和"warm restart"骨子里也是同一种思路。 动量法。1964 年苏联数学家 Polyak 提出"重球法"(heavy ball),借经典力学里"有惯性的球"的图像,让训练时积累的方向像球的动量一样保留下来,跨过狭窄的低谷不被来回弹。今天 Adam、Nesterov、AdamW 这一整套带"动量"的优化器都是这个物理直觉的工程版本。打开任何 PyTorch 训练脚本,那个 momentum=0.9 参数背后挂的就是牛顿力学。 SGD 就是布朗运动。深度学习训练的主力工具随机梯度下降(SGD),里面那个随机噪声项数学上对应 Langevin 动力学(法国物理学家 Paul Langevin 1908 年提出来描述布朗运动的方程)。物理学家看 SGD,看到的就是带阻尼的布朗粒子在势能场里乱跑。这个对应让 SGD 多了一个"贝叶斯采样"的物理学解释,2011 年 Welling 和 Teh 沿这条思路造出了 SGLD,今天用来做神经网络的不确定性估计。 HMC 采样。哈密顿蒙特卡洛(Hamiltonian Monte Carlo)是贝叶斯统计里用得最多的高效采样方法,直接用 2.1 节那个哈密顿力学。把要采样的概率分布想象成一个势能场,引入虚拟的"动量"变量让粒子在场里运动,物理学的能量守恒律保证了采样轨迹高效不退化。HMC 1987 年最早发表在一份纯物理期刊上,二十年后被统计学界捡起来,今天 Stan、PyMC 这些主流贝叶斯软件包默认采样器都是 HMC 的变种。 所以更准确的总结是:梯度下降这个基本工具来自数学。但"怎么更好地下降"这个工程问题,物理学贡献了一整套被沿用至今的方法(模拟退火、动量、Langevin SGD、HMC)。物理、统计、数值计算是三条共祖的平行河,AI 是它们的交汇口。能量、熵、自由能、最大熵这些是物理学专属的礼物,模拟退火和 HMC 这一脉是物理学借给优化领域的方法学,纯粹的梯度下降框架则来自数学。  # 三、Hopfield 网络:物理学家造的第一台"会记忆"的网络 第二章讲的是 AI 算什么,能量、熵、自由能这些底层骨架。从这一章开始往上走一层,讲物理直觉如何塑造了网络长成什么形状。这一层的东西不像第二章那样是地基,删了就跑不起来,更像设计灵感,但物理思想在这里实实在在地指导了几类最重要的网络长什么样。 第一个例子就是 Hopfield 网络。物理学家用 Ising 模型造出来的第一台"会记忆"的神经网络,也是 2024 年那个 AI 诺贝尔物理学奖的直接由来。 ## 3.1 Hopfield 其人与 1982 年那一步 John Hopfield是1933年生人,物理学家出身。父亲也是物理学家。他1958年在康奈尔大学拿了凝聚态物理博士,毕业之后先在贝尔实验室工作,然后去加州理工教书。他自己的学术身份从来不在"AI"里,几十年里发的论文主要是关于固体里的极化激元(polaritons)、血红蛋白的合作性、感觉神经元的动力学,研究方向横跨凝聚态物理、生物物理和神经科学。  John Hopfield 七十年代后期他开始关注神经网络。这个时机非常糟糕。1957年罗森布拉特(Frank Rosenblatt)发明感知机(perceptron),曾经引发过一波AI热潮。纽约时报当时报道说"海军展示了一台未来能学会走路、说话、看、写、复制自己并对其存在有意识的电子计算机"。但1969年麻省理工的明斯基(Marvin Minsky)和派珀特(Seymour Papert)合作出版了同名书《感知机》(Perceptrons),用数学证明了单层感知机连"异或"(XOR)这种最基本的逻辑运算都做不了。这本书直接把整个领域杀死。学术界把神经网络打入冷宫,研究经费枯竭,多数AI实验室转向了基于规则的符号系统。这就是后来被称为"第一次AI冬天"的开始。 1980年的世界几乎没人在认真做神经网络。Hopfield是一个稀有的物理学家局外人,从凝聚态物理的角度切入这个被遗弃的领域。他真正想搞懂的是大脑,造 AI 这件事根本不在他的目标里。 困扰他的具体问题是:你听见熟悉旋律的前 3 个音,脑子里整首歌就跳出来。你看见一张被遮住一半的脸,立刻认出来是谁。大脑这种"残缺输入 → 完整记忆"的能力是怎么发生的? 这种能力有个专门名字叫联想记忆(associative memory)。它跟计算机的内存正好反过来。计算机要先知道地址才能取出数据,你得告诉它"取第 1024 号位置的内容"。大脑反过来,给它一段内容的残片,它能找回整段内容。 Hopfield 的物理直觉是这样的:大脑里有几百亿神经元相互连接,是一个典型的物理"多体系统"。物理学家研究多体系统几十年的经验告诉他,这种系统经常有"吸引子"(attractor),就是系统自然会落进去的稳定状态。记忆能不能就是大脑状态空间里的吸引子?给一个起点(残缺的输入),让它自然滑落,落到最近的那个稳定状态,就是"想起来了"。 这是他真正想回答的问题:大脑这种集体回忆是怎么涌现出来的?这跟今天大家说的"训练神经网络"是两条完全不同的赛道。 1982年4月,他在《美国科学院院刊》(PNAS)发表了一篇5页的短论文,题目是《具有涌现集体计算能力的神经网络与物理系统》(Neural networks and physical systems with emergent collective computational abilities)。这篇论文做了一件惊人的事:把统计物理里描述自旋系统的能量函数原封不动搬过来当作神经网络的目标函数。  具体做法是这样的。假设有N个神经元,每个神经元的状态是 +1或 -1(类比自旋向上或向下)。任意两个神经元之间有一个对称的权重wᵢⱼ,描述它们的相互作用强度。整个网络的"能量"定义为E = -½ Σᵢⱼ wᵢⱼ sᵢ sⱼ。 Hopfield接着证明:如果让网络按照"每个神经元根据自己邻居的状态更新自己"的规则演化,能量永远不会上升。这意味着网络最终会停在能量曲面的某个低谷。 把这个低谷叫"记忆",整套机制就成立了。事先选定一些状态作为要记住的模式(比如几张图片),调整权重让这些模式恰好是能量曲面的低谷。然后给网络输入一个残缺或带噪声的模式,让它演化,网络会自动滚到最接近的那个低谷,也就是"想起"完整的记忆。 这个机制叫联想记忆(associative memory),跟人脑回忆的方式很像。给你一段熟悉的旋律的前几个音,你能想起整首歌,就是同样的过程。 ## 3.2 这个能量函数到底是什么 这里要打住一下,澄清一个对现代 AI 读者特别容易混的概念:Hopfield 的"能量"跟你训练神经网络时的"损失函数"完全是两回事。 现代深度学习里的"损失"是这样的:模型有一大堆参数(权重),训练时调这些权重让损失下降,训练完权重就固定,损失这件事就退场了。 Hopfield 网络反过来:权重是事先按你要记的图案直接算出来的,根本不需要训练。能量函数 E 定义在网络当前的"状态"上(哪些神经元开着、哪些关着),跟权重无关。给网络一个状态(比如一张残缺的图),让网络的状态自己演化往低能量方向滚,权重始终不变。能量的最低点就是一段记忆。 打个比方:现代神经网络训练像是在挖坑,调权重挖出几个洼地,训练完坑就挖好了。Hopfield 网络是先按你要记的图案挖好坑(按一个简单规则算出权重),然后扔一颗球进去(给输入状态),让球自然滚进最近的坑里。"想起一段记忆"就是球滚进了某个坑。 那么这个能量函数 E 究竟从哪里来?答案是物理学。Hopfield 网络的能量函数 E = -½ Σᵢⱼ wᵢⱼ sᵢ sⱼ,物理学家一眼就看出来是 Ising 模型。 Ising 模型由德国物理学家 Wilhelm Lenz 1920 年提出,他的学生 Ernst Ising 1925 年在博士论文里求解了一维情况。这个模型描述磁性材料里自旋之间的相互作用。一个磁铁有南北极是因为内部的电子自旋大部分朝同一个方向排列。Ising 模型把这种磁性材料抽象成一个晶格,每个格点上有一个"自旋"sᵢ,取值 +1 或 -1(代表向上或向下),相邻自旋之间通过 wᵢⱼ 耦合。  Ising 模型示意图 这个模型在物理学里被研究了一百年。1944 年 Lars Onsager 求解了二维 Ising 模型的相变,是统计物理史上最重要的精确解之一。 Hopfield 1982 年那一步的全部新意在于:把这个研究了六十年的物理模型直接"租"过来当神经网络用。神经元 = 自旋,权重 = 耦合强度,记忆 = 能量低谷。物理学六十年的全部数学工具和直觉,被一字不漏地继承给了神经网络。 更精确地说,Hopfield 网络属于 Ising 模型的一个变种,叫自旋玻璃(spin glass)。普通 Ising 模型里自旋之间的耦合是规则的(相邻自旋之间相互作用强度一样),自旋玻璃则是随机的,每对自旋之间的耦合强度都不同。这种随机耦合让能量曲面变得极其崎岖,有指数级多的局部极小值,每个谷底都是一个亚稳态。意大利物理学家帕里西(Giorgio Parisi)从 1970 年代开始研究自旋玻璃,发展出一套描述这类崎岖能量曲面的精巧数学工具,2021 年因此拿了诺贝尔物理学奖。今天物理学家研究神经网络损失函数的高维"地形",用的还是帕里西那套自旋玻璃工具。 这种"直接挪用"在科学史上很罕见。多数跨学科借鉴是借概念、借方法,借具体模型整套搬过来用极少见。Hopfield 这件事的特殊之处在于,他把物理学的一个现成模型贴上"神经网络"的标签直接发表了,连模型本身都没改造。 ## 3.3 它当年的成果与影响 Hopfield 1982 年那篇论文真正炸了的原因,是它真的能跑。论文里他演示了用几十个神经元的网络存几张二进制小图(比如简单的几何图案),然后把图加上噪声、或者直接擦掉一半再喂回去,网络让状态演化几步就能恢复到原图。这是"联想记忆"在人造系统里第一次能跑通的演示。 接下来几年里,这个简单架构滚出了一连串戏剧性的成果。物理学家很快用统计力学算出来:N 个神经元的 Hopfield 网络能可靠存储大约 0.14×N 个独立图案,也就是 100 个神经元大概能存 14 张图,再多就互相干扰、谁也想不起来。这个精确的容量公式让物理学界一下惊醒,意识到"我那套统计力学的工具能算 AI 的边界",于是大批物理学家开始往神经网络领域涌。Hopfield 自己 1985 年又跟同事一起把同样的网络拿去解组合优化问题(比如"旅行商问题",找一条最短路径走完所有城市),把代价当能量、让网络滚到低能量等于找到接近最优的解。神经网络第一次给计算机科学里出了名难的问题提供了一种新解法。 整个 1980 年代神经网络的复兴,Hopfield 这篇论文是公认的起点之一。更深远的影响是:1982 年这篇论文给被明斯基 1969 年那本书杀死的神经网络领域重新打开了一扇门。1986 年那篇引爆深度学习的反向传播论文(辛顿是作者之一)就是踩着这扇门发出来的。从那以后才有 80 年代末的连接主义复兴、2010 年后深度学习的爆发这条线。如果没有 Hopfield 1982 年这一步,神经网络可能还要在冷宫里多待十年。 ## 3.4 玻尔兹曼机:Hinton 那一半诺贝尔奖 2024 年诺贝尔物理奖给了两个人,Hopfield 和辛顿。前面三节讲完了 Hopfield 那一半。辛顿那一半工作叫玻尔兹曼机(Boltzmann Machine),1985 年他跟 Sejnowski、Ackley 三人合作做出来。这个网络看起来跟 Hopfield 网络很像,但有两个关键变化,把"物理学进 AI"这件事从"借一个现成模型"推进到了"教网络从数据学能量函数"。  Boltzmann Machine 变化一:从确定性到概率性。Hopfield 网络的神经元更新是确定的,按规则算就行,最终一定收敛到某个能量低谷。玻尔兹曼机不一样,每个神经元开还是关是按概率决定的,概率正好就是玻尔兹曼分布(也就是 exp(-能量差/温度))。从画面上讲,Hopfield 是把球丢进碗里让它静态滚下去,球到了局部最低点就停了。玻尔兹曼机是把球丢进碗里,但球时不时被随机踢一脚,跳出小坑去找更深的坑。这种随机扰动让网络能跨过局部极小,找到更全局的解。 变化二:能量函数从"事先算"变成"从数据学"。Hopfield 网络的权重是按你要记的图案事先算出来的,玻尔兹曼机反过来:给一堆数据(比如一万张猫的图),让网络自动调权重,使这些数据正好落在能量曲面的低谷上。这是 AI 历史上第一次出现"用训练方法学一个概率分布"的范式。今天所有生成模型(GAN、VAE、扩散模型、大语言模型)的训练目标都可以追溯到这一步。 辛顿后来沿着这条线推了一大步。他推动了一个简化版本叫受限玻尔兹曼机(RBM),训练效率高得多。2006 年他用 RBM 一层一层堆出"深度信念网络"(Deep Belief Network),第一次让真正"深"的网络能训得动。这是 2012 年 AlexNet 之前最重要的深度学习预训练方法,也是"deep learning"这个词重新热起来的起点。 2024 年瑞典皇家科学院颁奖给辛顿,主要就是表彰这条线:把物理的玻尔兹曼分布变成神经网络的训练目标,开启了"用统计物理学训练神经网络"这条路径。Hopfield 教会了 AI 怎么用能量函数,辛顿教会了 AI 怎么从数据学能量函数。这是两份大礼,构成了 2024 那个诺奖的两半。 ## 3.5 漂亮的转折:物理学派在 Transformer 里复活 从 1990 到 2010 年代,Hopfield 网络和玻尔兹曼机在 AI 主战场上都被边缘化了。 Hopfield 网络的问题很现实。储存容量太低(100 神经元只能存 14 张图),状态必须是二进制(+1/-1),跟真实世界的数据形式不匹配。1990 年之后它逐渐变成教科书里的"理论玩具",工程上没人真用。 玻尔兹曼机和 RBM 命运稍好。2006 到 2012 那几年它一度是深度学习预训练的标配,撑起了"deep learning"第一波热度。但 2012 年 AlexNet 用 GPU 加端到端反向传播打赢 ImageNet 之后,行业发现根本不需要 RBM 预训练,直接拿 SGD 训就够。RBM 被默默放进抽屉。 主流深度学习从此沿着另一条线狂奔:感知机 → MLP → CNN(LeNet → AlexNet → ResNet)→ RNN → LSTM → Transformer。这条线看起来跟 Hopfield、玻尔兹曼机毫无关系。物理学派那套"能量函数 + 自旋系统 + 玻尔兹曼分布"似乎只剩历史价值。 然后 2020 年发生了一件让所有人震惊的事。 奥地利林茨大学的 Sepp Hochreiter(LSTM 的发明人之一)团队发表了一篇题为《Hopfield Networks is All You Need》的论文,标题直接致敬了 2017 年那篇引爆大语言模型的 Transformer 原始论文《Attention Is All You Need》。论文证明了一件事:Transformer 注意力机制的核心公式,跟现代版(连续状态)Hopfield 网络的更新规则在数学上完全等价。 具体说,Transformer 的注意力公式 Attention(Q, K, V) = softmax(QKᵀ/√d) V 可以严格地重写成一个"现代 Hopfield 网络"做模式检索时的更新步骤。Hopfield 网络里"存储的记忆"对应 V(values),"查询模式"对应 Q(queries),"存储的键"对应 K(keys)。注意力机制做的"从输入里找出最相关的记忆并加权返回",本质就是 Hopfield 网络做的"从残缺输入滚向最近的低谷"。 这意味着每次你用 ChatGPT,它内部 Transformer 层的每一次注意力计算,本质都是在执行 Hopfield 1982 年那个"从残缺输入滚向最近记忆"的过程。同时 Transformer 训练时通过反向传播学的那个高维权重函数,本质也就是在从数据里学能量函数,正是玻尔兹曼机 1985 年开启的范式。物理学派以为已经被时代抛弃的两个想法,其实一直藏在今天最强大的 AI 系统内核里,没人察觉。  扩散模型示意图 回看时间差,这个故事戏剧性极强。Hopfield 1982 年那 5 页论文当年是物理学家的边缘探索,1985 年的玻尔兹曼机当年是个慢得没法用的玩具。1986 年反向传播一出,AI 主流就甩开物理学派往工程路线狂奔了 30 年,最后跑出来的 Transformer 居然结构上就是物理学派 35 年前那两个被遗忘的想法。这让 2024 年那个诺贝尔物理奖回头看更有分量。颁给 Hopfield 和 Hinton 的奖项含金量正在这里:他们 1980 年代用 Ising 模型和玻尔兹曼分布搭建的那两个简单架构里,已经包含了今天最强 AI 系统所依赖的核心数学结构。 ## 3.6 能量框架的两次延伸:EBM 和扩散模型 Hopfield 把"能量"这个物理框架第一次搬进神经网络。后来的故事是,这套"用能量定义系统"的思路被往两个方向继续延伸,每一次都催生了今天 AI 里的一类重要架构。 第一次延伸是能量基础模型(Energy-Based Models,EBM)。直接把概率分布定义成 P(x) ∝ exp(-E(x)),用神经网络去学这个能量函数 E(x)。生成数据就是从高能态滚到低能态,跟物理的退火过程一样。Yann LeCun(杨立昆,前 Meta 首席 AI 科学家)多年来力推 EBM 作为一个统一的深度学习框架,主张所有的判别和生成任务都可以用能量函数表达。他的论文里反复出现的图,就是一片高维能量曲面加几个标注的低谷。 第二次延伸更轰动,是扩散模型(diffusion models)。今天 DALL-E、Midjourney、Stable Diffusion 这些图像生成的主力工具,背后的扩散模型训练时学的"score function"(分数函数)数学上就是能量函数对数据的梯度。从噪声生成图像的过程,就是沿着能量曲面"逆向滚动",从高能态(噪声)回到低能态(清晰图像)。物理学家看 DALL-E 3 或 Midjourney 生成图像,看到的是 Boltzmann 一百多年前研究气体分子时建立的语言。 从 Hopfield 网络到 EBM 再到扩散模型,这条线一直在做同一件事:用一个能量曲面定义"什么是合理的状态",让系统朝最低能态滚。这是物理学送给 AI 的第二份大礼。第一份是 2.1 节那个"用能量描述系统"的总框架,这一份是把它具体兑现到了一类又一类的神经网络架构上。 # 四、对称性:诺特的思想如何决定网络的结构 物理思想在AI架构上最成功的一次落地,发生在"对称性"这个概念上。 ## 4.1 对称性是物理学最深的组织原则 对称性是物理学的元概念。一个旋转360度回到原样的物体有"旋转对称性",一个左右翻转还是自己的字母(比如M)有"镜面对称性"。物理学里的对称性更抽象,指的是"做某个变换之后系统的物理规律不变"。 德国数学家诺特(Emmy Noether)1918年在哥廷根证明了一条定理,是二十世纪理论物理最深刻的几个结果之一:每一个连续对称性都对应一个守恒律。 这条定理的具体内容是这样的。时间平移对称性(物理规律今天和明天一样)对应能量守恒。空间平移对称性(物理规律这里和那里一样)对应动量守恒。旋转对称性(物理规律朝东和朝西一样)对应角动量守恒。这些过去被分别发现的守恒律,被诺特用一条统一的数学定理串了起来。 诺特定理之所以是物理学的"元定理",是因为它教会了物理学家用一种新方式思考问题:研究一个系统的时候,先问它有什么对称性,再让对称性自动告诉你这个系统有哪些守恒量。基本粒子物理里的标准模型、广义相对论里的能量动量守恒、规范场论的所有结构,背后都是诺特定理。 把诺特从哥廷根请来的是希尔伯特(David Hilbert)和克莱因(Felix Klein),他们当时正在研究爱因斯坦的广义相对论里能量守恒的数学结构。诺特用了一年时间,把这个问题从特殊推到了完全一般的情况。她那篇论文叫《不变变分问题》(Invariante Variationsprobleme),1918年7月26日由克莱因代为提交。 这条定理跟数学史那两篇文章呼应。诺特是二十世纪最伟大的数学家之一,她在抽象代数(环论、模论)里也有奠基性工作,但物理学家最先记住她的,是这个 1918 年的对称性定理。 ## 4.2 核心思路:数据有什么对称性,网络就该内置什么对称性 对称性怎么进了神经网络?核心思路一句话讲完:如果数据有某种对称性,网络结构就应该把这种对称性内置进去,不让网络去重新学一遍。 最早把"对称性"做进神经网络的人,动机来自一个跟物理学完全无关的地方:抄哺乳动物的视觉皮层。 1962 年 Hubel 和 Wiesel 用电极在猫的视觉皮层上做实验,发现了两类神经元:simple cells 识别局部的边缘和方向,complex cells 对位置的小幅度移动天然不敏感。猫脑识别一只老鼠,不管老鼠在视野左边还是右边,complex cells 都能稳定响应。这是生物学层面的"平移不变性"。 1980 年日本科学家 Kunihiko Fukushima 把这套结构直接搬进神经网络,造了 Neocognitron。论文标题里就直接写着 "a self-organizing neural network model for a mechanism of pattern recognition unaffected by shift in position",平移不变性就是写在标题上的设计目标。1989 年 Yann LeCun 在贝尔实验室用反向传播把这套架构改造成实用版本,叫 LeNet,专门识别手写邮政编码数字。1998 年的 LeNet-5 在邮政编码识别上达到工业级精度,2012 年 AlexNet 在 ImageNet 上的胜利触发了深度学习革命。  Kunihiko Fukushima CNN 怎么内置平移不变性?核心是权重共享:卷积层用同一个小滤波器(kernel)扫过整张图,无论滤波器扫到哪里参数都是同一份。这意味着 CNN 天生就"知道"图像在哪里出现并不重要,只需要学一次"猫的特征",就能在任何位置识别它。一个朴素的全连接网络看到"左上角的猫"和"右下角的猫"会把它们当成两个完全不同的模式去学,CNN 不会。 CNN 的成功证明了一件事:把数据的对称性写进网络结构,性能提升是数量级的,不是边际的。一个 ImageNet 级别的分类任务,用 CNN 可能需要几千万张训练图,用对应规模的全连接网络可能需要几百亿张图才能达到同等精度。 但 Fukushima 和 LeCun 当年只做了"平移不变性"这一个具体的对称性,并没有意识到背后可以推广。把"任何数据对称性都该内置"抽象成一般原则,是 2010 年代后期"几何深度学习"(geometric deep learning,由 Michael Bronstein 等人推动)才完成的。这套理论说:识别出数据的对称群(平移、旋转、置换、规范变换等任意连续对称性),网络结构就被相应约束住。研究分子的网络要内置三维旋转对称性,研究图(graph)数据的网络要内置节点排列对称性,研究物理系统的网络要内置规范对称性,都是这条原则的落地。 所以这条线的真实历史顺序是:1962 年 Hubel-Wiesel 的猫脑实验 → 1980 年 Fukushima 把"平移不变性"抄进神经网络 → 1989 年 LeCun 工程化做出 CNN 雏形 → 2010 年代后期几何深度学习把它抽象成通用原则 → 这才回头跟 1918 年诺特定理建立起完整对应。一个走了 60 年的故事。 ## 4.3 最成功的兑现:AlphaFold 的等变网络 对称性原则在AI里最硬的一次兑现,是AlphaFold。  AlphaFold Protein Structure Database 蛋白质是由几百到几千个氨基酸串成的链,它们在三维空间里折叠成特定的形状,决定生物功能。预测蛋白质如何折叠,是结构生物学过去60年最难的问题之一。从1960年代开始,人类知道氨基酸序列决定折叠形状(Christian Anfinsen因此拿了1972年诺贝尔化学奖),但从序列预测形状的算法一直做不出来。 测定蛋白质三维结构在AlphaFold之前只有两条慢路。一条是X射线晶体学,把蛋白质结晶化然后用X射线衍射图反推三维结构,单个蛋白质平均要花几个月到几年,结晶化本身就是大量蛋白质做不到的拦路虎。另一条是核磁共振(NMR)和后来的冷冻电镜(cryo-EM),各有各的限制。到2020年人类已知的蛋白质序列大约有2亿个(来自基因测序),但其中只有约17万个的三维结构被实验测定出来。剩下99.9% 的蛋白质,序列我们知道,结构我们不知道。 CASP(Critical Assessment of Structure Prediction)是结构生物学界从1994年开始办的双年蛋白质结构预测竞赛,专门用来检验各家算法的真实精度。组织方拿一批最新实验测定但还没公开的蛋白质,让各队提交预测,最后跟实验值比较。CASP头二十年的进展一直缓慢,最好算法的平均精度(GDT评分)大约停留在30-40分(满分100),实际可用度有限。 DeepMind 2018 年第一次参加 CASP13 竞赛,第一代 AlphaFold(用传统 CNN + 距离预测,没有显式等变性设计)把这个数字推到了 60 多分,已经显著超越所有竞争对手,结构生物学界震动了一次。2020 年 12 月的 CASP14 比赛,AlphaFold 2 完全重新设计了网络架构,把 GDT 平均推到了 92 分,对 2/3 的蛋白质达到"接近实验测定"的水平。结构生物学界用了几年时间消化这件事的冲击,最终给出的判断是:60 年的蛋白质折叠问题被基本解决了。 更夸张的是后续。2021年7月,DeepMind跟欧洲生物信息研究所(EMBL-EBI)联合发布AlphaFold Protein Structure Database,开放了2万个人类蛋白质的预测结构。2022年7月这个数据库扩到2亿条预测,覆盖了几乎所有已知物种的几乎所有已知蛋白质。两亿条结构预测在两年内做完,这是X射线晶体学一万年都做不到的工作量。 AlphaFold 2 最关键的架构创新之一,就是把 SE(3) 等变性作为一个核心设计原则主动焊进了网络结构。具体载体是结构模块里一个叫 Invariant Point Attention (IPA) 的特殊注意力机制,由 DeepMind 团队自己设计,是诺特那一脉对称性原则在蛋白质结构问题上的工程化实现。 蛋白质有一个明显的对称性:一个蛋白质分子在三维空间里整体旋转或平移之后,还是同一个蛋白质,氨基酸之间的相对位置不变。这叫 SE(3) 对称性,SE(3) 是三维空间里所有"旋转加平移"操作构成的连续群。 朴素的神经网络不知道这个对称性。给它输入一个分子的坐标,它要花大量数据才能学到"我可以把这个分子旋转任意角度结论都一样"。但 IPA 把这个对称性直接焊进了网络结构里。无论输入怎么旋转,输出会按照对应的方式同步变换,这叫"等变"(equivariant)。 把对称性内置进网络的好处是数量级的。它意味着 AlphaFold 2 不需要用海量数据去"重新学"分子可以旋转这件事,所有的学习能力都用在真正的难题上:在给定相对位置约束下找最稳定的折叠。 这跟上一节 CNN 的故事正好反过来。CNN 是先做(1980 Fukushima 抄视觉皮层)后被抽象(2010 年代后期几何深度学习),中间隔了 30 多年。AlphaFold 2 反过来:把"数据对称性 → 网络等变"作为一般原则的几何深度学习社区刚在 2020 年前后成熟(Bronstein 等人 2021 年出了几何深度学习教科书,Fuchs 等人的 SE(3)-Transformer 论文也是 NeurIPS 2020 那一年发表的),DeepMind 团队几乎是第一时间把这套抽象工具用在了一个真实科学问题上。等变性在 AlphaFold 2 里是论文里主动声明的核心设计原则,DeepMind 团队从论文初稿到 Nature 发表都把它作为关键创新来标榜。 AlphaFold 2024年拿到诺贝尔化学奖。颁奖词强调的是"蛋白质结构预测"的成就,但这套成就背后的工程基础,是把诺特1918年那个对称性思想做成了一个真正能转的网络架构。 这是物理思想在AI里最硬的一次贡献。CNN 是数据的二维平移对称,AlphaFold 是三维空间的旋转加平移对称,本质都是同一个诺特原理。物理学送给 AI 的第三份大礼,是对称性原则。 # 五、重整化群:为什么深度网络要"深" 最后这一章讲一个还没完全兑现的对应,但启发性极强。 ## 5.1 重整化群是什么 要讲清楚重整化群是什么,先讲一个长期困扰物理学家的难题:同一个东西,在不同尺度下看起来完全不一样。 一杯水放在你面前。在分子尺度(10⁻⁹ 米)下,它是几万亿亿个 H₂O 分子在疯狂碰撞,每个分子按量子力学规律运动。在毫米尺度下,你看到的是一摊连续的液体,遵守流体力学的 Navier-Stokes 方程。在公里尺度下,它可能是一片湖,遵守气象学和水文学。这三种描述用的方程完全不同,但描述的是同一杯水。 物理学家长期面对的问题是:如果你只关心毫米尺度上的流体行为,你不需要追踪每个分子在干什么。具体哪个分子在哪里、跟谁碰撞,毫米尺度上看根本看不出来。怎么系统地从微观描述跳到宏观描述?换句话说,怎么把不相关的细节扔掉,只保留对你关心的尺度有用的信息? 这个"扔掉细节"的操作,有个专门的名字叫粗粒化(coarse-graining)。  重整化群示意图 打个比方。一张 4K 高清照片有几百万个像素。如果你把每个 2×2 的像素块合并成一个像素(取平均),照片变成 1080p。细节没了(你看不清沙子的纹理),但整体结构还在(你还认得出这是张海滩照)。再合一次:1080p → 540p。再合一次。每一次合并都丢掉一些细节,保留主结构。 物理学里的粗粒化做的就是这种事。1966 年美国物理学家 Leo Kadanoff 提出一个具体做法叫 block-spin(块自旋):拿一片晶格上的自旋系统(比如 4.1 节那个 Ising 模型),把相邻的几个自旋打包成一块,用一个"代表自旋"替代整块。N 个自旋的系统变成 N/4 个"块自旋"的系统。然后问一个关键问题:这个新的、更稀疏的系统,要遵守什么样的"等效规律",才能在你关心的尺度上重现原系统的宏观行为? 把这一步反复迭代。一次粗粒化把尺度从 L 推到 2L,再做一次推到 4L,再做一次到 8L,每次都把细节往上抹一层。这一系列从"细尺度规律"到"粗尺度规律"的变换,数学上构成一个"群"结构(严格说是半群,但历史上叫"群"沿用了下来)。这就是"重整化群"名字的由来:它指的就是这套"逐级粗粒化"的变换操作家族。 Kadanoff 的 block-spin 思想很漂亮,但还是定性的,没法精确算东西。1971 年 Ken Wilson 把它做成了一个真正可计算的数学工具。Wilson 用这套工具解了一个困扰物理学界二十年的难题(Kondo 问题,关于稀薄磁性原子在金属里的散射行为),也理解了相变(水变冰、铁磁体失去磁性这种)背后的精确数学。1982 年 Wilson 因此拿了诺贝尔物理学奖。  Kenneth Geddes Wilson (1936–2013) 重整化群最深刻的发现是普适性(universality):把粗粒化反复迭代之后,绝大多数的微观细节都被洗掉了,只有少数几个"重要"参数会留下来。这意味着完全不同的物理系统(比如水的沸腾和铁磁体失去磁性)在临界点(相变那一刻)的行为可能精确相同。它们的微观差异在反复粗粒化里被洗没了,剩下的只是几条相同的宏观法则。这套数学解释了为什么自然界里看起来八竿子打不着的现象会服从同一个规律。 ## 5.2 重整化群进入深度学习 深度神经网络为什么要堆很多层?传统的解释是"更多层能拟合更复杂的函数",但这个答案不令人满意,因为按照通用近似定理(universal approximation theorem),一个隐藏层足够宽的网络理论上能拟合任意连续函数。为什么实践中"深"比"宽"更有效? 物理学家给的一个解释是:每一层网络都在做一次粗粒化。 视觉网络是最典型的例子。一个 ResNet 处理图像,第一层抓的是像素级别的低阶特征(边缘、颜色),第二层抓的是稍大尺度的纹理,第三层抓的是物体的局部部件(眼睛、轮子),最深层抓的是语义概念(猫、汽车)。每一层都把上一层的"原子"合并成下一层的"分子",把尺度往上推一级。研究自然语言处理的人发现 BERT 也类似,浅层抓词法、中层抓句法、深层抓语义,同样是逐层抽象的尺度结构。 这跟重整化群的粗粒化迭代结构惊人地像。从这个视角看,深度的本质就是"尺度",远远超出了单纯的工程参数。 2014 年 Pankaj Mehta 和 David Schwab 发表了一篇题为《An exact mapping between the Variational Renormalization Group and Deep Learning》(变分重整化群与深度学习的严格对应)的论文,把这个直觉真正数学化了。他们证明,在 受限玻尔兹曼机(RBM) 这种特定架构下,深度学习的训练过程跟重整化群的粗粒化操作完全数学等价。 具体说他们证明了什么?回忆 3.4 节,RBM 有一层"可见单元"对应输入数据(比如图像的像素),一层"隐藏单元"对应学到的抽象特征。Mehta 和 Schwab 证明,训练一个 RBM 学到的"从可见层到隐藏层"的映射,数学上就是 Kadanoff 那种块自旋粗粒化操作的一个变体(叫"变分重整化群")。把多层 RBM 堆起来做深度信念网络的时候,每加一层就严格对应在做一次粗粒化迭代。深度学习里"层"这个概念,在这个特定架构里就是物理学里的"尺度层级",是严格的数学等价。 但这个结果有两个明显的局限。一是它只对 RBM 这一种架构严格成立。今天主流深度学习用的是 CNN、ResNet、Transformer 这些架构,2014 那时候还没有人证明它们跟重整化群之间存在同样严格的对应。二是这个结果是解释性的:它告诉你"为什么这种深度结构能 work",并没有告诉你"该怎么设计下一个更好的网络"。这跟 4 章 CNN 那条线对照鲜明,那边对称性原理直接给出了"应该用卷积层 + 权重共享"的设计指令,重整化群目前还做不到这一步。 不过 2014 之后这条 RG 线本身一直在生长。2021 年 James Halverson、Anindita Maiti 和 Keegan Stoner 发表《Neural Networks and Quantum Field Theory》,把 Mehta-Schwab 的"RBM ↔ RG"对应推广到更一般的神经网络:无穷宽极限下的神经网络对应自由量子场论,有限宽修正对应粒子相互作用,整个训练过程可以用 Wilson 重整化群流来描述。2022 年 Erbin、Lahoche、Ousmane Samary 把这套框架做成非微扰版本,得到一个漂亮的结果:改变神经网络权重的标准差,数学上等价于在"网络空间"里做一次 RG 流。  到 2024 年 5 月,欧洲核物理理论中心(ECT*)专门开了一周的"Machine Learning and the Renormalization Group"研讨会,把这条线汇成了一个独立的研究方向。2025 年 10 月 Coppola 等人发表的《Renormalization group for deep neural networks: Universality of learning and scaling laws》是这条线最新的尝试。他们在一个受限的玩具模型下(弱非线性的神经网络 + 幂律分布的数据),用 RG 框架做出了 neural scaling laws 跟 RG fixed points 之间的形式对应,引入"scaling intervals"这个概念替代传统的"scaling dimensions"。  Credit: https://groups.oist.jp/pbu/event/seminar-relation-machine-learning-and-renormalization-group-ising-model 更广义地讲,这条线只是物理学跟深度学习理论接口的一支。同期一批物理学家加入 AI 理论领域,发展出 neural tangent kernel(NTK)、mean field theory of neural networks 这一类不直接基于 RG 的框架,试图回答同一个核心问题:"我们手里那个能跑的大模型,到底为什么能跑?"这是今天物理学跟 AI 之间最活跃的理论接口之一。 回过头看"深度即尺度"这个直觉,今天已经从比喻变成了一个被反复验证的工程经验。研究图像的人发现 ResNet 的不同层对应图像的不同空间尺度,研究 NLP 的人发现 Transformer 不同层对应语言的不同抽象层次,研究语音的人发现类似的层级化结构。Mehta-Schwab 那篇论文是这条直觉第一次有了严格数学背书。 ## 5.3 诚实地说:这个研究方向还在半路上 但要诚实地说一句:重整化群跟深度学习的对应,目前还更多是理解视角,没变成能指导设计的硬工具。 什么意思?以CNN为例,对称性原理直接告诉了我们"应该用卷积层、参数共享、池化",是具体的设计指令。AlphaFold的等变网络也是,诺特原理直接告诉我们"应该用SE(3) 等变层"。这些是物理思想直接给出了网络结构。 重整化群目前还没给出这种级别的设计指令。它解释了"为什么深度有效",但没告诉我们"每一层应该具体怎么设计、有多少层、各层之间怎么连接"。这些今天仍然由工程经验和大量试错决定,不是物理推导出来的。 为什么这个对应还没兑现?一个可能的原因是,物理学的重整化群有一个核心前提,系统在不同尺度下要表现出"自相似"或"标度不变"。神经网络是不是真的具有这种性质,目前还不完全清楚。深度网络在尺度变换下的行为,可能比物理系统复杂得多。 但这一章值得放在这里,因为它代表了物理思想流进AI的一个仍在生长的方向。前几章讲的对应都已经"兑现"过了,能量曲面有了EBM,对称性有了CNN和AlphaFold,Hopfield网络有了Transformer的等价证明。重整化群目前还停在"启发性"阶段,但下一个十年完全有可能从启发性变成第一性。 这也是这一章故意放在最后的原因。物理思想流进AI不是一个完成时的故事,它是一条仍在延伸的河。 # 结尾:上半篇是物理"被借走"的故事 回头看上半篇梳理的这些线索。 物理藏在 AI 的数学里。能量、熵、自由能、最大熵原理这些十九世纪到二十世纪初的物理概念,今天是每一行 PyTorch 代码的底层数学结构。神经网络的训练在数学上是参数空间里的能量极小化问题,生成式模型的推理在数学上是玻尔兹曼分布采样问题。这套语言来自统计力学一百多年的积累,AI 只是拿来直接用。 物理也藏在 AI 的架构里。能量曲面给了 EBM 和扩散模型的图像基础。Hopfield 网络的 Ising 模型骨架在结构上预言了 Transformer 注意力。诺特的对称性原则让 CNN 和 AlphaFold 成为可能。重整化群解释了"为什么深度有效"。这四条线穿过的概念,几乎全是物理学几代人留下的遗产。 为什么偏偏是物理学,而不是数学、化学或者其它学科?因为神经网络在数学结构上恰好是一个"多体系统":千亿个参数、互相耦合、整体涌现出宏观行为。这正是统计力学被设计来对付的那类问题。一个高能物理或凝聚态物理的博士生学过的工具,搬到深度学习里几乎可以无缝接管。所以 2024 年诺贝尔物理学奖给霍普菲尔德和辛顿、化学奖给 AlphaFold,本质都是同一件事:物理学借出去的工具,在 AI 手里产出了第一份诺贝尔级别的成果。 但所有这些故事有一个共同特征:到目前为止,是物理在被 AI "借走"。AI 拿走物理学积累两个世纪的工具,用得很顺手,物理学本身却几乎没有因为 AI 的崛起而开出全新的研究问题。霍普菲尔德 1982 那篇论文,等到 42 年后才被诺奖追认。这 42 年里真正被点燃的是 AI 这门学科,物理学自己还停在它 1970 年代后期以来的相对停滞里。 这跟我之前在《学物理的八方英雄们,物理学已死,请转行搞 AI》里讲的那个判断一致:物理学过去半个世纪在基础理论上停滞,它的核心遗产被 AI 接管使用,自己反而像一个"已经停止演化的母语"。 唯一一点新的迹象是 5.2 提到的"物理学家用统计物理工具研究深度学习"那条线。从 Mehta-Schwab 2014 之后,神经切线核(NTK)、神经网络的平均场理论这些工作慢慢生长起来,一批转行做 AI 理论的物理学家开始系统研究"为什么深度网络能 work"。但这条线目前还只是物理学家在解释 AI 已经造出来的东西,没有反过来给物理学本身打开新的研究问题。换句话说,AI 给物理学家提供了新饭碗,没给物理学这门学科带来新课题。 下半篇《当物理遇上 AI:深度学习里的物理元素(下)》会讨论几个目前还停留在类比层面、但可能更深的对应:涌现 vs 相变、scaling law vs 标度律、损失曲面 vs 自旋玻璃,以及一个反面问题,AI 会不会反过来给停滞的物理学带来第二春。 ## 作者其它文章 - 一文看懂美国的法律系统 - 教宗良十四世论人工智能(精华版) - 廉颇老矣,尚能饭否:现代数学史(下) - 一篇文章讲清楚美国的移民系统 - 毕业典礼上嘘声四起:美国年轻人讨厌 AI? - 大航海时代 2 的逆向工程实验 - 量子计算机有前途吗? - 祖父积分学概论 - 我见青山多妩媚:二十世纪数学史(上) - 一文讲清楚美国医疗系统 - AI 如何打进美国教育生态? - 一篇文章看懂美国教育全生态 - 马斯克把 xAI 并入 SpaceX,到底意味着什么? - Vibe Learning:AI 时代,学习这件事被重新组织了 - 福特经济学和 AI 经济学 - 数学照妖镜:AI 能发现新的数学定理吗? - Vibe Reading:AI 时代读书的系统化方法 - 两万字科普:AI 为什么会编程,原理、历史与未来 - 全网最详细的 AI 学习路线图 ## 相关链接 - [snowboat](https://x.com/snowboat84) - [@snowboat84](https://x.com/snowboat84) - [6.3K](https://x.com/snowboat84/status/2060145538922844179/analytics) - [https://groups.oist.jp/pbu/event/seminar-relation-machine-learning-and-renormalization-group-ising-model](https://groups.oist.jp/pbu/event/seminar-relation-machine-learning-and-renormalization-group-ising-model) - [学物理的八方英雄们,物理学已死,请转行搞 AI](https://x.com/snowboat84/status/2044584627046920278) - [一文看懂美国的法律系统](https://x.com/snowboat84/status/2059795010330251568) - [教宗良十四世论人工智能(精华版)](https://x.com/snowboat84/status/2059434342745866391) - [廉颇老矣,尚能饭否:现代数学史(下)](https://x.com/snowboat84/status/2059071134738620606) - [一篇文章讲清楚美国的移民系统](https://x.com/snowboat84/status/2057980486501433383) - [毕业典礼上嘘声四起:美国年轻人讨厌 AI?](https://x.com/snowboat84/status/2057619169341026321) - [大航海时代 2 的逆向工程实验](https://x.com/snowboat84/status/2057264254319993332) - [量子计算机有前途吗?](https://x.com/snowboat84/status/2056895775578456417) - [祖父积分学概论](https://x.com/snowboat84/status/2056533111983493136) - [我见青山多妩媚:二十世纪数学史(上)](https://x.com/snowboat84/status/2055446902171406761) - [一文讲清楚美国医疗系统](https://x.com/snowboat84/status/2055081426744422697) - [AI 如何打进美国教育生态?](https://x.com/snowboat84/status/2054721509420372180) - [一篇文章看懂美国教育全生态](https://x.com/snowboat84/status/2054359249917210633) - [马斯克把 xAI 并入 SpaceX,到底意味着什么?](https://x.com/snowboat84/status/2054000682114613488) - [Vibe Learning:AI 时代,学习这件事被重新组织了](https://x.com/snowboat84/status/2052908751435477046) - [福特经济学和 AI 经济学](https://x.com/snowboat84/status/2052551731385602072) - [数学照妖镜:AI 能发现新的数学定理吗?](https://x.com/snowboat84/status/2052174034041995572) - [Vibe Reading:AI 时代读书的系统化方法](https://x.com/snowboat84/status/2050008577511973253) - [两万字科普:AI 为什么会编程,原理、历史与未来](https://x.com/snowboat84/status/2048919554882215954) - [全网最详细的 AI 学习路线图](https://x.com/snowboat84/status/2047457686070141051) - [Upgrade to Premium](https://x.com/i/premium_sign_up) - [7:45 AM · May 29, 2026](https://x.com/snowboat84/status/2060145538922844179) - [6,311 Views](https://x.com/snowboat84/status/2060145538922844179/analytics) - [View quotes](https://x.com/snowboat84/status/2060145538922844179/quotes) --- *导出时间: 2026/6/5 11:14:40*
什 什么是信息论?它和AI是什么关系? 文章深入浅出地讲解了信息论的起源、核心概念及其与人工智能的关系。内容涵盖香农在1948年奠定的信息论基础(如熵、比特、信道容量定理),回顾了奈奎斯特、哈特利及玻尔兹曼等前人的贡献,并探讨了交叉熵、KL散度等概念如何成为衡量AI模型误差的关键工具。文章指出,尽管信息论为AI提供了度量语言,但在解释智能本质上仍有局限。 技术 › LLM ✍ snowboat🕐 2026-07-11 信息论香农熵交叉熵人工智能AI深度学习科普基础知识数学
如 如何利用神经网络在交易中获得优势:量化交易框架指南 文章深入探讨了如何利用神经网络构建量化交易系统。作者解释了对冲基金如何利用机器学习提取交易优势,揭示了神经网络计算条件期望的数学本质,而非直接预测未来。文中分析了为何直接预测价格会失败,并提出了正确的数据处理方法和架构选择,旨在为交易者提供一个从数据准备到信号部署的完整实施框架。 技术 › 量化交易 ✍ Roan🕐 2026-05-07 神经网络量化交易机器学习对冲基金算法交易深度学习数学基础交易策略投资技术分析
如 如何成为一名机器学习工程师:完全指南 本文是一份详细的机器学习(ML)工程师学习路径指南。作者首先纠正了被动观看视频的学习误区,提出“两遍学习法”以建立深刻的技术理解。文章明确了ML工程师与数据科学家及研究员的区别,强调工程实现能力。随后,作者将学习路径分为两个阶段:第一阶段利用 3Blue1Brown 的视频构建数学直觉,涵盖神经网络、梯度下降、反向传播及 Transformer 架构;第二阶段(文中截断处未完)预告将通过 Andrej Karpathy 的课程来提升代码实现能力。 技术 › 机器学习 ✍ Arman Hezarkhani🕐 2026-01-21 机器学习学习路径神经网络Transformer深度学习职业发展LLM3Blue1BrownKarpathy教程
M Math Behind Large Language Model 本文介绍了大语言模型背后的数学原理,涵盖Attention机制、缩放因子、反向传播、梯度下降、交叉熵损失、RoPE位置编码和RMSNorm归一化等核心概念。 技术 › LLM ✍ Amit Shekhar🕐 2026-07-30 LLM数学原理AttentionTransformer机器学习深度学习梯度下降反向传播RoPERMSNorm
从 从邓煜2026年菲尔兹奖的数学工作看人工智能 文章通过分析2026年菲尔兹奖得主邓煜关于硬球动力学与玻尔兹曼方程的数学工作,探讨了人工智能的数学本质。文章指出,AI的核心能力在于在没有已知全局方程的情况下进行可学习数值计算,并强调AI的宏观能力源于局部数学结构的长期演化与闭合,而非单纯规模扩张。 技术 › 人工智能 ✍ deep Manifold🕐 2026-07-24 菲尔兹奖数学理论深度学习可计算性涌现数值计算神经网络系统演化
流 流体力学研究史 文章回顾了流体力学三百年的发展历程,从阿基米德的静力学开端,到达芬奇的观察,再到欧拉建立场论方程。文章重点探讨了流体力学拥有完美方程却无法预测湍流的悖论,以及非线性项带来的数学挑战,并最终将落脚点引向了现代AI技术。 读书 › 科普 ✍ snowboat🕐 2026-07-17 流体力学科学史欧拉湍流物理学方程数学达芬奇科普方法论
什 什么是希尔伯特的第六问题?这个问题重要吗? 文章介绍了希尔伯特1900年提出的第六问题,即“物理学公理的数学处理”。文章详细梳理了该问题的历史背景,包括当时的物理学危机、原子论与唯能论的争论,以及希尔伯特试图从微观原子运动严格推导出宏观连续介质定律的数学野心。文章还关联了2026年菲尔兹奖得主邓煜对该问题相关领域的研究贡献。 读书 › 书评 ✍ snowboat🕐 2026-07-15 希尔伯特数学史物理学公理化菲尔兹奖原子论统计力学科学科普
P PyTorch 训练流程速查表 这是一份关于 PyTorch 训练流程的单页速查表。文章通过代码示例和原理解析,深入浅出地讲解了张量的核心概念、矩阵乘法、自动求导机制、反向传播以及梯度下降优化过程。同时涵盖了 `nn.Module` 常用组件如 Linear、ReLU 和 GELU 的使用,旨在帮助开发者快速理解深度学习引擎的运作原理。 技术 › 编程语言 ✍ kozue🕐 2026-07-03 PyTorch深度学习教程张量Autograd机器学习速查表矩阵乘法反向传播Python
别 别让 Codex 总结整本书,用 Codex 陪你读一章 本文反对直接使用 AI 总结全书,指出这会导致理解外包和记忆流失。作者提出以“章”为单位的陪读方法,利用 Codex 生成读前问题、评估复述盲点、设计应用场景并生成章节卡片。该方法强调主动回忆与自我解释,将 AI 作为反馈工具而非替身,旨在通过最小闭环实现深度阅读。 技术 › Codex ✍ 撸猫不掉毛🕐 2026-06-19 AI阅读深度学习提示词方法论自我解释主动回忆知识管理读书笔记
如 如何从零开始构建自己的大语言模型 (LLM) 文章揭秘了 GPT、Claude 等 LLM 背后通用的五阶段构建流程,指出数据质量而非架构才是核心。作者详细阐述了数据清洗、分词、训练目标(预测下一个 Token)及 Transformer 架构实现,并提供了包含 Tokenizer 和 PyTorch 模型的代码示例。 技术 › LLM ✍ Rahul🕐 2026-06-14 LLMTransformer深度学习模型训练分词PythonPyTorch源码解析方法论
当 当物理遇上AI:深度学习里的物理元素(下) 本文是《当物理遇上AI》的下篇,探讨了深度学习中的未解难题与物理学现象的同构关系。作者详细分析了Scaling Law与临界标度律、模型涌现与相变、双下降曲线与随机矩阵理论之间的深层联系。文章评估了这些类比证据的强弱,指出部分物理数学工具已能精确推导AI行为,同时也讨论了争议与未解之谜。 技术 › LLM ✍ snowboat🕐 2026-06-05 物理学深度学习Scaling Law涌现双下降相变随机矩阵理论Scaling Law涌现双下降相变随机矩阵理论
什 什么是 Diffusion Model?图片视频生成模型全网最详细介绍 本文详细介绍了AI图像与视频生成背后的核心技术——扩散模型(Diffusion Model)。文章通过通俗易懂的语言,解释了其物理起源、从加噪到去噪的运作原理,以及它如何凭借稳定性优势逐渐取代GAN成为生成式AI的主流范式。 技术 › AI基础 ✍ snowboat🕐 2026-06-02 Diffusion ModelAIGC机器学习图像生成深度学习原理科普