# 当物理遇上AI:深度学习里的物理元素(下)
**作者**: snowboat
**日期**: 2026-06-05T00:02:22.000Z
**来源**: [https://x.com/snowboat84/status/2062686432335184321](https://x.com/snowboat84/status/2062686432335184321)
---

## 引子
《当物理遇上AI:深度学习里的物理元素(上)》梳理了物理学已经嵌进AI的部分。能量、熵、自由能、Hopfield、对称性、重整化群,这些是既成事实,板上钉钉。整个深度学习的数学骨架里,物理学的工具一件件被借了过去,用得很顺手。
但AI这门学科除了既成事实,还有一批更深的问题。Scaling Law为什么是幂律?某些能力为什么在某个规模突然出现?双下降曲线为什么和经典统计学唱反调?Grokking这种"过拟合之后突然学会泛化"的现象到底是怎么回事?所有AI的研究人员都看到了这些现象,但没有人能从理论上解释。它们被业内称为AI的open questions。
一个物理学家看到这批问题,会有一种特殊的感受:似曾相识。物理学过去一百多年里,面对自然界时碰到过结构上非常相似的谜。幂律对应临界标度律,突然出现对应相变,"过拟合后突然好"对应过冷液体的晶化,违反经典统计学预期的双下降对应高维统计的相变现象。每一个AI open question都能在物理工具箱里找到一个长相相似的兄弟。
这种"似曾相识"有几分是真的?是物理工具箱里的工具真的能拿来推AI的现象,还是只是表面像?这是本篇要追问的第一件事。
第二件事更重要:物理学家如何在AI里下注。这件事已经做了二十年,有一套被群体默契接受的标准流程,产生了少数中奖的彩票(扩散模型最出名),也产生了大量没中奖的彩票(自旋玻璃→损失曲面、重整化群→深度学习、张量网络→分类器)。把成功案例和失败案例放到一起,能看出物理方法论在AI里真正的命中率,以及下一步有没有更好的方式。
这两件事合到一起,指向一个更大的问题。物理学在自己的领地停滞了半个世纪,它的工具被AI接管使用,自己却没获得新的研究问题。AI会不会反过来给物理学带来第二春?答案藏在那些还没被认真试过的物理根族里:可积系统、Lindblad开放系统、KPZ表面生长、Hubbard-Heisenberg。下一张中奖的彩票可能就藏在其中某一个。

# 一、物理类比 AI:哪些是真同构,哪些只是看起来像
上篇讲了两层物理在AI里的位置。底层是物理数学直接嵌进AI,玻尔兹曼分布、变分自由能、Langevin动力学这些工具被搬过来当训练目标和采样机制。中层是物理直觉塑造了网络的形状,Hopfield的Ising能量函数、CNN的平移对称性、AlphaFold的E(3) 等变性、深度网络的"层"结构对应重整化群的逐层粗粒化。
这两层有一个共同特征:物理的具体工具被用进AI了。要么公式直接搬过来用,要么物理直觉指导了架构设计。读者能看到一个清楚的因果链,是物理在主动贡献。
第三层的性质不同。它讲的是另一种关系:"AI里有某个现象,它的行为规律和物理里某个已知现象的规律在数学上是同构的"。两边的研究对象完全不同,但是用同一套数学描述。
这种同构如果成立,意义会很大。物理学已经有一套处理那个现象的完整理论,这套理论可以直接拿来预测AI的行为,给出定量预言。不需要在AI里再造一遍轮子。
1900年的普朗克(Max Planck)面对黑体辐射就是这样。黑体辐射的实验曲线和经典理论完全对不上,多年没人能解释,直到普朗克找到了和谐振子能量量子化的同构。整个量子力学从这一刻炸出来。同构本身就是发现,找到了同构,剩下的工作有现成的数学。
AI的open questions里,有没有哪个是"等待着自己的普朗克时刻"的黑体辐射?这是本篇要认真追问的问题。
先说结论。AI的几个核心open questions里,物理第三层的证据强弱差异很大。
第一档证据强的两个:Scaling Law和临界标度律的形式对应几乎严丝合缝,双下降的随机矩阵理论已经在线性模型上给出了严格推导。这两个有可能真的是数学上的同构。
第二档证据中等的两个:损失曲面和球面自旋玻璃模型有严格的等价证明(但需要假设数据随机),Grokking和过冷液体晶化的物理图像很贴,但数学还没建立起来。
第三档证据弱但有潜力的几个:涌现和相变形式上像,但Schaeffer等人的工作让这个对应变得有争议。神经网络表示空间的几何结构和拓扑物质有形式对应,但还在早期。In-Context Learning几乎找不到物理对应。
这张分级地图就是本篇前半段的骨架。下面五章逐个展开。
# 二、第一朵乌云:Scaling Law 与临界标度律
物理第三层里证据最强、数学工作最扎实的方向,是Scaling Law。
## 2.1 一条不能解释的幂律
2020年1月,OpenAI的Jared Kaplan等人在arXiv上传《Scaling Laws for Neural Language Models》(arXiv:2001.08361)。这篇论文系统测量了一件事:语言模型的性能(test loss)随参数量N、数据量D、算力C的变化曲线。
结果干净得让人意外。三条曲线都是幂律。Loss ∝ N^(-α),Loss ∝ D^(-β),把它们画在对数坐标轴上是直线。指数α_N约0.076,α_D约0.095。

Figure from Scaling Laws for Neural Language Models
Kaplan测的参数范围从约1000到15亿(6个数量级),数据规模从22M到23B tokens(也是6个数量级),全程都成立。他还报告:在测的范围里,网络宽度、深度这些架构细节对幂律指数影响很小。模型性能怎么随规模涨,背后有一条对架构相对不敏感的规律。
但没人能从理论上推导出这条幂律。也没人知道为什么指数是这两个数。一个工程界靠它指导训练GPT-3、GPT-4的核心经验规律,在理论上完全是黑箱。
2022年DeepMind的Jordan Hoffmann等人在Chinchilla论文里重新检验了Kaplan的指数,发现Kaplan系统性低估了数据规模的重要性。修正后的核心结论:对每倍模型大小,token数应该等比例倍增(约20 tokens/parameter,跟Kaplan测的比例差很多)。这条修正没改变"幂律本身存在"的判断,只是改了具体指数。Scaling Law作为一个经验现象更加稳固,但它的精确形式仍在被持续修正。

Figure from Jordan Hoffmann et al. (2022)
## 2.2 物理学家认出了这个形状
这个形状物理学家见过太多次。物理里有一类标准结构叫临界标度律。
物理系统在相变临界点附近,几乎所有可观测物理量都服从幂律。比如铁磁体在居里温度T_c附近,磁化强度M ∝ (T-T_c)^β,比热C ∝ |T-T_c|^(-α)。关键的事实是:这些临界指数对所有满足同一对称性的材料都一样。不同的材料,不同的微观相互作用,临界指数完全相同。物理学把这种现象叫"普适类"(universality class),意思是临界点附近的行为由系统的深层对称性决定,跟微观细节无关。
AI的Scaling Law和这个形式完全一样。都是幂律,指数对实现细节不敏感,跨越多个数量级。Kaplan的论文里"换架构不影响指数"那句话,在物理学家眼里就是universality class的标志。
还有一层:临界标度律的背后是重整化群。系统在临界点附近的行为由重整化群的不动点决定。如果AI的Scaling Law真的是临界标度律,上篇5.x节讲过的重整化群在这里又一次出现了。物理工具箱里的同一把工具,被用在AI里的不同层级。

## 2.3 有人开始认真做这件事
Eric Michaud、Liu、Girit、Tegmark 2023年那篇arXiv:2303.13506《The Quantization Model of Neural Scaling》是这个方向走得比较深的一次尝试,2024年正式收进NeurIPS。
他们的想法是把Scaling Law拆解成"quanta"(离散的能力块)的累积。每个quantum是模型在数据里学到的一个具体技能。当quanta按使用频率降序学习时,频率分布本身的幂律就能解释loss随规模的幂律下降。这套框架同时预测了Scaling Law和涌现,因为新quanta被学会的时刻对应能力的突然出现。
这种工作走得更远。它要从理论上推出指数α、β应该是多少,然后和实验对照,而不是停留在"Scaling Law看起来像临界标度律"这个判断上。如果这条路走通,AI的Scaling Law会从"经验观测到的规律"变成"可以从第一性原理推导的理论预言"。意义会非常大。

## 2.4 诚实地说:机制层面还没打通
临界标度律的物理来源是重整化群不动点。要把这套理论严格推到AI上,要回答几个问题:AI的"不动点"是什么?"临界点"在哪个维度上?"序参量"在AI语境下是什么?这些问题目前还没有清楚的答案。
形式上的对应极强。指数普适、跨数量级、对细节不敏感,这些特征AI和物理临界现象都有。但机制层面的对应还差一步。AI不一定真的处在临界点附近,可能只是某种深层的统计普适性碰巧产生了类似的形式。
诚实评估:这是AI的open questions里物理第三层证据最强的一个。有可能是真实的同构,但还没被严格证明。这是本篇里最值得长期跟踪的一个方向。
# 三、第二朵乌云:涌现与相变
第二个open question是涌现。这是物理第三层里最戏剧性的对应,但也是被质疑过的。
## 3.1 一件让所有人困惑的事
语言模型有一种特别的行为:某个能力在小规模时完全不存在,超过某个规模突然出现,像开关被拨动。
2022年6月,Google的Jason Wei等人在arXiv上传了《Emergent Abilities of Large Language Models》(arXiv:2206.07682),TMLR同年发表。论文系统记录了一组"涌现能力":算术推理、多步推理、语言类比、TruthfulQA等等。

模型的“涌现”能力 from Wei et al. (2022)
这些能力的图像有多奇怪?以三位数加法为例:在1000亿参数以下,所有不同规模的模型准确率都接近零。超过某个规模阈值,准确率突然跳到70% 以上。中间的过程几乎完全不可见。
这种"突然"在工程上很麻烦。它意味着小模型的能力曲线无法外推到大模型。GPT-3之前没人能用GPT-2的曲线预言GPT-3会出现什么新能力。
## 3.2 物理学家的反应:这不就是相变?
水到一百度突然变成蒸汽,铁磁体过居里点突然失磁。这种"突然"在物理里有严格的定义,是热力学极限下的不连续。系统的某个宏观量(密度、磁化、序参量)在某个控制参数处发生不连续跳变。
朗道(Lev Landau)1937年的相变理论给了这件事一个数学骨架。定义一个序参量(order parameter),它在相变点从零跳到非零,对应一个对称性的破缺。一阶相变是序参量本身的不连续跳变,二阶相变是序参量的导数不连续。

物质的相变 from wiki
AI涌现和这个形式上几乎完全一样。把准确率当成序参量,参数规模当成控制参数。某个规模处准确率从近零跳到高值,看起来正是朗道理论里的相变。物理学家看到Wei那篇论文时的第一反应几乎都是这个。
## 3.3 一个严重的质疑
但2023年4月,Stanford的Rylan Schaeffer、Brando Miranda、Sanmi Koyejo在arXiv上传《Are Emergent Abilities of Large Language Models a Mirage?》(arXiv:2304.15004),论文当年拿了NeurIPS 2023的Outstanding Paper Award。
他们提出一个问题:AI的"涌现"是不是测量方式造成的幻觉?
他们的发现:如果换一个更连续的指标(比如token-level的log-likelihood,而不是整道题对错的0-1准确率),涌现现象消失了,曲线变成连续平滑增长。
意思是:离散的准确率指标本身造成了"看起来像突然出现"的错觉,底层的连续量其实是平滑增长的。当模型从"做对5% 的步骤"涨到"做对95% 的步骤"时,整道题的对错从0跳到1,但底层的步骤准确率是连续涨的。
这个发现让"AI涌现 = 真实相变"这个类比的基础动摇。如果离散指标的幻觉解释了大多数涌现,那物理第三层在这里就只是测量伪影,不是真同构。
## 3.4 争议没有结束
Schaeffer的质疑也被反质疑。并不是所有涌现都能被连续指标消解。某些算法能力(比如多位数乘法、特定的推理任务)即使在更细的指标下也确实存在阈值。Anthropic和Google DeepMind后续的工作里都报告过某些任务有真正的相变特征。
Michaud那套Quantization Model在这里也提供了一个新视角。如果模型的能力是由离散的quanta累积的,每学到一个新quantum对应一个能力跳变,那物理上像一阶相变是有可能的。但quanta本身的频率分布决定了宏观曲线是平滑的,所以又像Schaeffer说的"测量幻觉"。两种观点在这个框架下可以同时成立。
诚实评估:这是物理第三层里最戏剧性的类比,但证据有争议。目前的状态是"可能是真实相变,也可能只是测量幻觉,可能两者都有",尚未定论。这是本篇里最需要继续观察实验结果的一个方向。
# 四、第三朵乌云:双下降与随机矩阵
双下降是物理工具进AI进得最深的一条。其他open question里物理工具大多还停在"形式上像"的层次,这一条已经走完了下一步。物理学的数学工具被直接拿来,把这条AI曲线精确地推出来了。两边能画等号。
## 4.1 一条让统计学教科书翻车的曲线
机器学习教科书的第一章都会先讲一条U形曲线,叫偏差-方差权衡。这条曲线的故事是这样。模型太简单时学不会东西,误差大(这叫"欠拟合")。模型变复杂之后误差降下来。到某个甜蜜点之后,模型开始死记硬背训练数据,新数据反而做不好,误差又涨上去(这叫"过拟合")。整体画出来一个U形,最优解在U的底部。这条规律统治了统计学几十年,是几乎所有人的常识。
2018年底,Ohio State的Mikhail Belkin和几个合作者做了一件让所有人意外的事。他们没停在U形的底部,继续把模型变大,看看会发生什么。结果在一个特定的点(模型参数数刚好等于训练数据点数)之后,误差不仅没继续上升,反过来重新开始下降,最终比U形底部还低。这条"先降后升再降"的曲线被他们叫做双下降(double descent,论文2019年发在PNAS,arXiv:1812.11118)。

Double Descent示意图
这件事直接打脸了几十年统计学教科书。但它对今天的大模型时代意义重大。GPT-4有上万亿参数,按经典统计学早就该过拟合烂掉了,实际却越大越好。双下降是"为什么大模型work"这个谜的关键侧面。它告诉所有人,大模型工作的机制跟教科书写的完全是另一套。
## 4.2 物理工具直接推出了它
经典统计学解释不了双下降,但物理学家手里有一套现成的工具,直接把它推出来了。
这套工具叫随机矩阵理论。它的出身在核物理。1950年代物理学家想算重原子核里几百个核子的能级分布,发现一个个算下去根本算不动,太复杂了。物理学家Eugene Wigner换了个思路:既然算不清精确解,那就用一个随机矩阵当核子相互作用的代理,问"随机矩阵的特征值大致按什么规律分布"。这个看起来粗暴的简化竟然给出了和实验对得上号的预言。从那以后物理学家磨这个工具磨了快70年,整理出一整套描述"随机矩阵谱性质"的数学。

2019年,Stanford的Trevor Hastie联合Andrea Montanari等人把这套核物理工具搬到了双下降上(arXiv:1903.08560,2022年正式发表在Annals of Statistics)。做法是这样:把神经网络的训练问题改写成一个高维矩阵问题,然后用物理学家磨好的工具去算这个矩阵的行为。结果是一组定量预言,包括双下降的峰值出现在哪、峰值有多高、过了峰值之后衰减得多快。全部能从理论上推出来,和实验严格对得上号。
这一步意义在哪?前面几章讲的物理对应都还停在"AI里有现象,物理里有像的现象,形式上对得上"的类比层级。这一条不一样,物理学的数学工具直接给出了AI现象的精确数学描述。两边能画等号。
物理学家看这件事还有一个直观图像:模型参数刚好等于数据点数那个临界点,AI系统从一个"相"切到了另一个"相",整个行为机制变了。这跟水到100度突然变蒸汽是同一类现象(叫相变)。双下降的那个峰值就是相变点。
## 4.3 还在往真正的深度网络推
目前严格的随机矩阵分析主要做完了线性模型和核方法这种相对简单的对象。真正的深度神经网络(几十层、带非线性激活、几十亿参数)还没有完整的严格推导,但方向是对的,在一步步往那个目标推。
几个代表性工作。Song Mei和Andrea Montanari 2019年(arXiv:1908.05355)把分析推到了两层神经网络的简化版本上。Jeffrey Pennington从ICML 2017起一系列工作用自由概率(随机矩阵理论的进阶版)研究了深度网络的关键性质。每一步都是物理工具在往神经网络的真实复杂度上推。

Figure from Song Mei & Andrea Montanari (2019)
一个自然的问题是:能不能给GPT-4这种规模的真实网络也算出它的双下降曲线?从线性模型到真实深度网络,数学复杂度跨了好几个台阶,能不能做到、什么时候能做到,目前都是开放问题。
诚实评估:这是物理工具进AI进得最深的一条。线性模型已经严格做完,深度网络是下一步。在本篇所有open question里,这是最接近"物理直接拿来用"那个理想状态的一个。
# 五、Grokking 与亚稳态
Grokking是几个open question里最神秘的一个。物理学家有一个非常对应的图像(过冷液体晶化),但严格的数学还没人做出来。
## 5.1 一个像"突然顿悟"的现象
想象一个学生第一周就把所有作业题的答案背了下来,作业卷子全对,但拿一道新题给他立刻不会做。继续让他做题做几十倍长时间,某一天他突然"开窍"了,从"背答案"切换成"懂底层规律",新题也能做对了。这种"长期机械记忆之后突然懂"的现象在机器学习里也观察到了,叫grokking(这个词来自Heinlein科幻小说,意思是"彻底理解")。
2022年初,OpenAI的Alethea Power和几个合作者在一类小算法任务(比如模运算加法)上发现了这个现象(arXiv:2201.02177)。他们的Transformer训练几百步就把训练集的误差降到接近零,明显过拟合了。这时候测试集准确率接近瞎猜。按经典学习理论,这就是死局,已经背完了,继续训练只会更过拟合。但他们没停手,继续训练到原来的几十倍甚至几百倍时间。然后在某一刻,测试集准确率突然快速爬升,最终达到接近完美的泛化。

这件事颠覆了一个常识。整个机器学习里有一条规则叫"早停"(early stopping):一看到训练误差降下来而测试误差开始涨,就停。grokking说明这条规则在某些情况下是错的。继续训练下去可能会有"顿悟"。这背后的机制是什么,到今天还是开放问题。
## 5.2 物理图像:过冷液体的晶化
最接近的物理图像是亚稳态与晶化。把瓶装水放进冰箱缓慢降到零度以下,水仍然保持液体状态,没有结冰。这是一个亚稳态:能量比真正的冰高,但被某个能量势垒挡住了,没法直接跳过去。给它足够长的时间或者一点扰动(比如轻轻一敲),它会在某个时刻突然结晶,从亚稳态翻越势垒进入稳定态。
神经网络在过拟合状态可以看作一个亚稳态。它找到了一个能完美拟合训练集的"记忆解",但这个解没有真正学到底层规律。继续训练相当于在等它"结晶"到一个能量更低的"算法解"。这个算法解被某个势垒挡住,需要时间或随机扰动(梯度下降里的噪声)才能翻过去。
这个图像后来被神经网络可解释性的实验证实了。2023年初Neel Nanda等人(arXiv:2301.05217,ICLR 2023)把grokking之后的Transformer"打开"看里面学到了什么,发现网络确实在内部实现了一个具体的算法:用离散傅里叶变换加三角恒等式做模加法。grokking是真实的模式切换过程,从"死记硬背"切到了"推导算法",不是噪声里抖出来的偶然。"记忆"是亚稳态,"算法"是稳定态,跟过冷液体晶化的图像对得很贴。

## 5.3 物理图像清楚,数学还没人做
物理上的图像清楚,但严格的数学还没建立。要把过冷液体的相变理论严格用到grokking上,要先把神经网络的损失曲面映射到一个有清晰势垒结构的物理系统,目前没人做到。Nanda那篇是机制层面的实验观察,不是物理数学层面的推导。
诚实评估:这是几个open question里物理对应最贴、最值得物理学家认真做一遍的现象。物理图像现成,亚稳态和晶化的数学工具在统计物理里很成熟,工程上差的是"把它对到神经网络上"的具体桥梁。这件事谁先做出来,可能就是下一个像扩散模型那样的"物理→AI"成功案例。
# 六、其他值得关注的 open questions
前面四章讲了证据相对集中的四个open question。剩下的几个,物理对应强弱不一,每个单独写一章撑不起来。这一章一起过,给出一个完整地图。
## 6.1 损失曲面与自旋玻璃
神经网络训练的过程是在一个超高维空间里找解。这个空间里有无数个"局部最优",也就是稍微动一下就变差的点。按常识,梯度下降应该掉进某个差的局部最优出不来,结果实际训练下来梯度下降总能找到不错的解。为什么?
物理学家在一类无序磁性材料(叫自旋玻璃)里碰到过非常相似的局面。这类材料里几百万个小磁针互相耦合,能量曲面也有无数个局部最优。Giorgio Parisi(2021年诺贝尔物理奖得主之一)几十年前研究自旋玻璃时给出过一个反常识的预言:绝大多数局部最优的能量都接近全局最优。换句话说,掉进任何一个都不亏。
如果神经网络的损失曲面真的和自旋玻璃等价,这条预言正好解释了梯度下降为什么能work。2015年Anna Choromanska联合Yann LeCun等人在AISTATS发了一篇论文(arXiv:1412.0233),严格证明了在数据是随机的假设下,深度网络的损失曲面和球面自旋玻璃模型数学等价。
但这个等价有个核心假设:数据随机。真实数据有结构,跟随机数据差很远。后来的实验观察发现,真实的损失曲面比球面自旋玻璃友好得多,有大片平坦的极小值区域和低损失的连接路径,跟"无序自旋玻璃"那种崎岖图像差距明显。Choromanska的工作框架对了一半,预言对了一半,但工程影响有限。

## 6.2 表示空间几何与拓扑物质
训练好的神经网络内部,词汇和概念被表示成高维向量。这些向量之间有奇特的几何关系。最有名的例子是 king - man + woman ≈ queen:词向量的加减法对应了语义关系。
物理学里有一类类似的现象叫拓扑保护。凝聚态物理里某些材料的性质(比如电流方向)对参数微小扰动稳健,不会因为细节改变而消失,是被"拓扑"这个全局结构保护的。神经网络表示空间里那些"跨模型稳定"的几何结构(不同模型训出来都有 king - man + woman ≈ queen),跟拓扑保护在形式上有对应。
研究者已经在用拓扑数据分析(一种数学工具,能从一堆高维数据里识别出"洞"、"环"这种全局结构)研究神经网络的表示空间。但这是一个正在生长的方向,距离能给出定量预言还很远。
诚实评估:物理对应有,但还在早期。

## 6.3 In-Context Learning:物理对应最弱的一个
你给GPT-4输入五个加法例子("1+1=2, 3+5=8, 7+2=9, 4+4=8, 6+3=9"),然后问 "8+5=?",它能直接答对。重点是它没有更新任何参数,纯粹通过读这五个例子,在前向推理过程中"学会"了你想问什么。这种现象叫 in-context learning(上下文学习,简写ICL)。
ICL不止能做加法。给它几个英中翻译例子,它能跟着翻译。给它几个情感分类例子,它能跟着分类。给它"按JSON格式输出"的几个示范,它能照做。任何能在prompt里举例的任务都能现学现用。这件事2020年GPT-3论文(Brown等人)当成核心demo推出来之后,成了大模型今天所有"少样本能力"和"按指令做事"的底层基础。
这件事在机制上很怪。传统机器学习里"学习"这个词有一个清楚的定义:参数被梯度下降一步步更新,损失函数因此下降。没有参数更新就没有学习。ICL完全跳过了这一步,输入序列里几个例子,模型就"懂"了任务。这逼着所有人重新问"学习到底是什么"。
现有的解释路径都不在物理这条线上。Garg等人2022年那篇工作(arXiv:2208.01066)证明Transformer在推理时内部能跑出一个梯度下降算法,等于说"学习"还在发生,只是从训练时的参数空间挪到了推理时的中间激活空间。Anthropic的Catherine Olsson等人2022年发现Transformer里有一种叫 induction heads 的电路,专门干"前面出现过的模式在后面复现时把它抓出来"这件事,是ICL的机制硬件。
这些解释都属于计算机科学层面(说明Transformer在做什么计算)。物理意义上的同构("这跟物理里某个已知现象在数学结构上对得上")至今没人找到。前几章用的那些物理工具(统计力学、相变、随机矩阵、亚稳态)都直接套不上来。
如果有人能找到严格的物理对应,是个开放的潜力方向。但目前看,ICL也可能要等一个跟物理学没什么关系的全新数学框架,从可计算性理论、动态系统或者别的方向来。这是本篇所有open question里物理工具最够不着的一个。

## 6.4 这一章的小结
把六七个open question放到一起,按物理对应的证据强度排列:
证据强:Scaling Law(临界标度律)、双下降(随机矩阵理论严格推导)
证据中等:损失曲面(自旋玻璃,但需要数据随机假设)、Grokking(亚稳态图像清楚,数学未严格)
证据弱但有潜力:涌现(相变图像,被Schaeffer质疑)、表示几何(拓扑物质对应,还在早期)
几乎空白:In-Context Learning
这张地图里有一个值得注意的模式:证据最强的方向,正好和数学工具最成熟的方向重叠。Scaling Law对应的临界标度律和重整化群是凝聚态物理几十年磨出来的核心成果。双下降对应的随机矩阵理论是统计物理的成熟工具。Grokking的亚稳态理论也是非平衡统计力学的现成工具。
这背后有道理:物理学家在AI里看到的同构,受限于他们手里有什么工具。"有工具的人才能看到对应"这件事,既是物理方法论的力量,也是它的盲区。In-Context Learning这种没有现成物理工具的现象,可能要等一个全新的数学框架,跟物理学没什么关系。
# 七、用物理工具造 AI 模型:一套"买彩票"的活动
前面六章讲了物理和AI结合的第三层,用物理来类比AI的问题。从这一章开始,我们来说物理+AI的第四层,也就是方法论的层面:物理工具是否可以直接运用在AI建模中,把物理模型搬到AI模型上去。这样的方法,命中率多少,都是谁在做?
物理工具箱里有上百件工具,每件工具都可以拿来尝试造一个AI模型,等于买一张彩票。绝大多数彩票没中,少数大成。第七章讲买彩票这套活动本身,第八章把几张没中的彩票摆出来,第九章把那张中了大奖的(扩散模型)完整讲完。
## 7.1 物理工具箱:能造 AI 模型的原材料
物理学几代人积累了一个庞大的数学工具箱。每一件工具原则上都可以拿来尝试造一个AI模型或一类训练方法。
部分清单:
- 统计力学(玻尔兹曼分布、配分函数)→ 玻尔兹曼机、能量模型EBM
- Ising / Hopfield模型 → Hopfield网络、associative memory、Modern Hopfield
- 变分自由能 → VAE、ELBO训练目标
- Langevin / Fokker-Planck方程 → 扩散模型、Flow Matching
- 对称性和群论 → CNN、E(3) 等变网络(AlphaFold核心)
- 重整化群 → 深度网络的层级解释
- 张量网络(MPS、PEPS) → 用作分类器和压缩工具
- 自旋玻璃 → 损失曲面分析
- 此外还有路径积分、混沌动力学、临界现象、Hamilton力学、拓扑物质等十几件
工具箱里至少有上百件这样的工具。每一件背后是物理学家几十年到上百年的积累。AI这门学科出现之前,这些工具已经在物理里有完整的数学和直觉。把它们搬到AI上看会发生什么,是一次次的尝试。

## 7.2 买一张彩票:怎么用一件物理工具尝试造一个 AI 模型
每"买一张彩票"在操作上有一些共同步骤。这套步骤没有谁规定,是过去二十年这群人在反复试错里磨出来的共同工作方式。
第一步:在AI现象里识别一个数学形状。幂律、相变、无序极小值、对称性破缺这些形状物理学家见过太多次,一眼就认出来。这是识别"哪件物理工具可能套得上"的入口。
第二步:从工具箱里挑那件对应的物理工具,造一个简化的AI模型。把网络宽度推到无穷(mean-field limit),把数据假设成高斯分布,把非线性换成简单形式。在这个玩具版本上推出一个具体的训练目标或架构。
第三步:在MNIST或CIFAR-10上把这个模型跑起来,看它work不work。物理学家做验证的标准是"曲线形状对、定性结论对",不追求SOTA。
第四步:写论文,标题挂上物理关键词。thermodynamics、renormalization、phase transition、spin glass、free energy这些词会让物理学家感到亲切,也让ML审稿人觉得"理论有点意思"。
第五步:投NeurIPS、ICML或物理顶刊。等。
每完成一轮,相当于买完一张彩票。下一篇论文换一件物理工具再买一张。

## 7.3 命中率:几百比一甚至更低
这套买彩票活动的命中率非常低。
过去二十年,用物理工具造AI模型的严肃尝试发了几百上千篇论文。真正变成工程界天天用的工具的只有少数:
- 中了的:扩散模型(Sohl-Dickstein 2015 → DDPM → 主流图像 / 视频生成器)、Hopfield网络(被2020年Modern Hopfield重新捡起,证明跟Transformer attention数学等价)、等变网络(AlphaFold的核心架构)
- 没中的:自旋玻璃损失曲面(Choromanska 2015)、重整化群RBM(Mehta-Schwab 2014)、张量网络分类器(Stoudenmire-Schwab 2016)、自由能原理通用AI(Friston持续二十年)
这是一个典型的长尾分布。少数中奖的工作改变了整个行业,绝大多数发完论文之后停在"理论上漂亮、工程上没人用"的状态。每一篇论文都是买了一张彩票,要中的概率不超过百分之几。
第八章把四张没中的卡具体摆出来,第九章把那张中了大奖的卡(扩散模型)完整讲完。读这两章时记住:每一个案例背后是一次具体的"用某件物理工具尝试造AI模型"的尝试,所有这些尝试用的都是上面这套五步的流程。
## 7.4 谁在买彩票
买彩票这件事的玩家分两群。
第一群是学术派,集中在几个核心实验室,有一个有名字的细分研究community叫机器学习统计物理(statistical physics of machine learning),加起来几十个核心PI和几百个PhD / 博后:
- EPFL:Lenka Zdeborová、Florent Krzakala、Matthieu Wyart
- Stanford:Surya Ganguli、Andrea Montanari
- MIT:Max Tegmark团队(含Eric Michaud、Ziming Liu),以及IAIFI研究所
- Boston University:Pankaj Mehta
- Harvard:Matthew Schwartz
学术派买彩票的产出主要停在toy model级别和理论论文,命中率低但产出快。
第二群是目标在造可用模型的物理出身研究者,跨学术界和工业界,没有统一社群名字,但贡献了大多数真正中奖的工作:
- John Hopfield:凝聚态物理博士,早年在AT&T Bell Labs工业研究院,1980年代到Caltech,后回普林斯顿。1982年那篇关键论文发在Caltech时期,把Ising模型搬进神经网络造了Hopfield网络,2024年诺贝尔物理学奖
- Geoffrey Hinton:理论物理本科出身转认知科学博士,长期在多伦多大学,后在Google Brain工作十年。把Hopfield推进到Boltzmann机和RBM,开启2000年代深度学习复兴,2024年另半个诺贝尔物理学奖
- Jascha Sohl-Dickstein:UC Berkeley生物物理博士,前NASA火星车研究员,后Google Brain、DeepMind,现Anthropic。造出了扩散模型
- AlphaFold团队:DeepMind内部一批从物理转过来的研究者,把等变性原则推到蛋白结构预测的工业级落地,2024年诺贝尔化学奖
两群人买彩票的风格不同。第一群每买一张发一篇论文,可以小规模快速试错。第二群每买一张要把模型工程化到能用,周期长、成本高,但一旦中奖回报巨大。下面两章讲的案例两边都有。
# 八、成功的物理模型
第七章讲了从物理模型到AI模型的方法论。这一章具体看这个方法论的成功率如何。
成功的物理模型按工具源头分两支:一支是从Ising模型出发的自旋系统族(含对称性 / 等变这一脉),另一支是Diffusion Model。这两支在历史上几乎覆盖了"用物理工具造出来的、真正改变AI工程界的所有成功模型"。
第一支在上篇3章和4章已经详细写过,这里只做方法论小结,把分散的成功案例归到同一条工具线上。第二支上篇只点了一句("扩散模型是能量框架的第二次延伸"),这里完整展开它的九年时间线,因为它是物理→AI这条路上最干净的一次成功,路径对所有想做类似事的人都有参考价值。
## 8.1 自旋模型族:物理工具进 AI 命中率最高的一支
物理工具箱里命中率最高的一支是Ising模型这一族。它们的共同结构是"用能量函数定义系统行为",工具来自统计力学(玻尔兹曼分布、配分函数、变分自由能)。把这族里中过奖的模型按时间排:
1982年的Hopfield网络是这条线的起点。物理学家John Hopfield直接把Ising模型mapped成神经网络,做联想记忆。这是"用物理工具造AI模型"这件事的第一个标志性案例。完整故事见上篇3.1-3.3节。
1980年代的Boltzmann机和RBM接着把Hopfield推进了一步。Hinton在Hopfield基础上加随机性,让网络能学到数据的概率分布。这条线后来发展出Deep Belief Network等架构,2000年代后期是深度学习的主力。完整故事见上篇3.4节。
2020年的Modern Hopfield是这条线最戏剧的复活。Ramsauer等人发现Hopfield网络的连续版本跟Transformer的attention在数学上等价。Ising这条物理线在Transformer时代意外被认出来还在跑。完整故事见上篇3.5节。
2010年代以来的EBM能量基础模型是Yann LeCun力推的统一深度学习框架,把概率分布定义为exp(-E)。完整故事见上篇3.6节。
这条线最终拿到了诺贝尔奖。2024年诺贝尔物理学奖颁给了Hopfield和Hinton,颁奖词明确点了"用物理学方法做神经网络"这件事。从1982到2024,42年。
跟自旋族并列、命中率也很高的另一支是对称性 / 诺特族,工具源头是物理学的群论。这一支里:
1980年的Fukushima Neocognitron到1989年LeCun的CNN,把视觉皮层的平移对称性内置进网络。这是对称性进AI的第一次工程级落地。完整故事见上篇4.2节。
2020年DeepMind的AlphaFold 2用SE(3)等变性把蛋白质折叠这个60年老问题基本解决了,2024年拿到诺贝尔化学奖。完整故事见上篇4.3节。
把自旋族和对称性族放到一起看,过去40年里物理工具进AI拿到诺贝尔奖的成功案例都在这里了。Hopfield + Boltzmann机走Ising这条线,CNN + AlphaFold走对称性这条线。两条线背后是同一个判断:把物理学积累几十年的数学结构(能量、对称性)写进网络架构里,比让网络自己从数据里学这些规律强一个数量级。

## 8.2 Diffusion Model:物理工具进 AI 命中率最干净的一次
跟自旋族和对称性族不同,Diffusion Model没有上一辈物理学家几十年的铺垫。它从Sohl-Dickstein 2015年那篇论文开始算起,到今天图像和视频生成器主导生成式AI的局面,前后只有十年。这十年的故事完整展示了"一篇物理论文如何在冷了五年之后被工程化激活,最终成为生成式AI的基础设施",是物理→AI路径最清晰的一次成功样本。
## 8.2.1 一个生物物理博士的普通尝试
Jascha Sohl-Dickstein 2012年从UC Berkeley拿到生物物理博士学位,在Bruno Olshausen的Redwood理论神经科学中心做训练。他的研究方向是用统计力学和动力系统的思想处理复杂概率模型。博士前还在NASA喷气推进实验室做过Mars Exploration Rover上的尘埃动力学研究。
2015年3月,他在arXiv上传《Deep Unsupervised Learning using Nonequilibrium Thermodynamics》(arXiv:1503.03585),ICML 2015发表。论文的思路:把有结构的数据(比如图像)按非平衡热力学里的扩散过程一步步加噪声变成完全无序的状态,然后训练一个神经网络学会反向走,从噪声里逐步恢复结构。
论文摘要里直接写"核心思想受非平衡统计物理启发"。这是一篇典型的"物理学家用熟悉的工具尝试ML题目"的论文。
## 8.2.2 五年的沉默
发出来之后,冷了整整五年。
2015到2019年间,这篇论文的引用数缓慢爬升,五年加起来不到两百次。同期GAN的原始论文每年引用是几千次。如果在2019年问任何ML研究者这篇论文,他们大概率没听说过什么叫做Diffusion Model。
这五年里物理方法论圈里也没人把它当成"下一张中奖的大彩票"。生成模型这块阵地完全被GAN占领。BigGAN、StyleGAN、CycleGAN一个接一个出来,每一个都是NeurIPS的顶级oral。扩散模型只是ICML论文堆里一个看起来挺有意思但不知道怎么scale的尝试。
Sohl-Dickstein本人在这五年里也没把扩散模型当作主线,他做了大量其他统计物理 × ML的工作。论文沉默时他在Google Brain,后来去了Google DeepMind,今天在Anthropic当Member of Technical Staff。
## 8.2.3 2020 年:何宏嘉的工程化
转折在2020年6月。何宏嘉(Jonathan Ho),UC Berkeley的CS博士生,他和Ajay Jain、Pieter Abbeel在arXiv上传《Denoising Diffusion Probabilistic Models》(arXiv:2006.11239,简称DDPM)。这篇论文做了一件关键的事:把Sohl-Dickstein那套复杂的变分推导简化成一个极其干净的训练目标,让网络在每一步预测"被加进去的噪声是什么",损失函数是一个简单的均方误差。
物理学语言在这一步开始消失。论文里没有"非平衡热力学",没有"扩散过程的物理解释",只有"前向加噪、反向去噪、预测噪声"。整个框架被翻译成了ML工程师能直接理解和实现的形式。
结果是DDPM在CIFAR-10上获得FID 3.17、Inception Score 9.46,首次让扩散模型生成的图像质量超过GAN。第一次让所有人意识到这条线可能比GAN更好。
这一年DDPM的引用还有限,关注度集中在小圈子。2021年起,引用数爆炸性增长,主流ML界开始大量做扩散模型工作。
## 8.2.4 宋飏的数学化
2021年ICLR,宋飏(Yang Song)和Sohl-Dickstein、Kingma、Kumar、Ermon、Ben Poole联合发表《Score-Based Generative Modeling through Stochastic Differential Equations》(arXiv:2011.13456,ICLR 2021 Oral)。
这篇论文用随机微分方程(SDE)的语言重新统一了整个扩散框架。前向加噪是一个SDE,反向去噪是这个SDE的逆。从此扩散模型有了一个干净的数学骨架:score function是SDE的核心,DDPM、score matching、Langevin动力学都是这个统一框架的特例。论文在CIFAR-10上的FID进一步降到2.20。
统计物理的语言到这一步被彻底替换成了数学语言。不再是"热力学",是"SDE"。扩散模型在数学骨架上更接近经典随机过程理论,而不是统计物理。
## 8.2.5 之后
之后的故事大家都知道。2022年起开源图像生成器一波接一波,2023年消费级图像生成器走入大众,2024年扩散范式被推到了视频生成。今天主流的图像和视频生成产品几乎全是扩散模型的后代。
Sohl-Dickstein 2015年那篇"普通的物理学家的普通尝试",经过五年冷落、一次工程化简化、一次数学重表述,成了生成式AI革命的种子。前后跨度九年。
如果想看扩散模型的技术细节展开,可以参考另一篇《什么是 Diffusion Model?全网最详细介绍》。本节聚焦的是方法论:物理学家的论文走到工程师手里之后发生了什么。
## 8.2.6 这个故事真正说明什么
把扩散模型九年的故事拆解,能看到四步演化。第一步是物理学贡献了最初框架,Sohl-Dickstein 2015那篇是核心insight的源头,但在2020之前这个insight没有产生任何工程影响。第二步是工程化激活,何宏嘉2020年那篇DDPM做的核心工作是把变分推导简化到ML工程师能直接拿来用的形式(物理层面没有新创新),这一步剥掉了物理语言。第三步是数学化让它成为严肃理论,宋飏2021年的Score SDE把整个框架翻译成SDE语言,进一步剥掉了物理标签。第四步是物理标签彻底消失、框架成为基础设施,今天工程界讲"扩散模型"时几乎不再提"非平衡热力学",物理出身的痕迹只剩论文引用里那篇2015的源头。
这是物理方法论在AI里成功的标准路径:物理 → 工程化(剥语言)→ 数学化(剥标签)→ 成为基础设施。
严格说,Diffusion Model是个边界案例。原始思路确实来自非平衡热力学,但最终爆发的工程版本已经把物理工具基本剥离了。今天写图像生成器训练代码的工程师不需要懂任何统计物理,只需要懂score function、noise prediction、SDE这些纯数学工具。如果按"用没用物理工具"严格筛选,Diffusion Model算是一个"借了物理的名字和最初灵感,但最终靠数学和工程接力跑出来的"案例。它跟自旋族(Hopfield直接mapped Ising)和对称性族(CNN/AlphaFold直接用群论)不一样,那两族是物理工具一直显式存在的。
# 九、失败的物理模型
第八章讲了中奖的物理模型。这一章把"造出来但没活下来"的物理模型摆出来,建立失败案例的分母。
注意筛选标准:只算"真的造了一个AI模型并试图在主流任务上用"的案例。纯解释性工作(用自旋玻璃解释损失曲面、用临界标度律解释Scaling Law这种"用物理工具事后分析AI现象"的工作)不在这一章里。前面6.x节已经讨论过那些解释性工作的命运。下面四个失败案例每一个都是"物理学家造了一个AI模型"。
## 9.1 RBM 时代:从主流跌到边缘
Restricted Boltzmann Machine(RBM)是8.1节提过的Hinton力推的模型,2000年代后期到2010年代初期是深度学习的主力。Hinton 2006年那篇《A Fast Learning Algorithm for Deep Belief Nets》开启了深度学习复兴的浪潮,Deep Belief Network把RBM堆叠起来一度是ImageNet之前最强的图像识别架构。这条线的物理出身很硬:RBM本身就是Boltzmann机的简化版,背后是Ising模型那套统计力学。
但2012年AlexNet在ImageNet上的胜利之后,工程界快速从RBM/DBN转向了CNN。RBM的训练算法(contrastive divergence)跟反向传播比效率低、可扩展性差,对GPU不友好。到2015年前后RBM在主流ML圈基本被淘汰,Hinton自己也转向了别的方向。
Pankaj Mehta和David Schwab 2014年10月在arXiv上传《An exact mapping between the Variational Renormalization Group and Deep Learning》(arXiv:1410.3831),证明了RBM的逐层变换和Kadanoff块自旋变换在数学上严格等价。论文在物理学界引起极大关注,被认为是深度学习的理论解释突破,物理学家激动了好几年。但论文发出来时RBM已经是夕阳模型,CNN已经全面接管。这个漂亮的物理对应停在了数学层面,没产生任何工程影响。Transformer时代之后,更没人去找它跟新架构的对应。

玻尔兹曼机 vs 限制玻尔兹曼机。Credit: Zahid Akhtar
RBM是个特殊的"半失败"案例:先成功(2006-2012年是深度学习的主力)后失败(2012年后被CNN淘汰)。它说明物理工具能造出一时的成功模型,但能不能持续下去取决于工程效率,跟物理上的优雅没关系。
## 9.2 张量网络分类器(Stoudenmire-Schwab,2016)
Edwin Stoudenmire和David Schwab 2016年的论文《Supervised Learning with Tensor Networks》(arXiv:1605.05775,NeurIPS 2016)展示了一件事:用矩阵积态(Matrix Product States,MPS)当分类器在MNIST上能跑到不到1% 测试错误。性能不差于当时的浅层网络。
这条线的物理动机很硬。张量网络是量子多体物理里描述纠缠态的核心工具,被Roman Orus、Frank Verstraete这批人发展了二十多年。MPS本身是描述一维量子系统基态的标准方法。把它用进ML,相当于把量子物理的核心工具搬到机器学习。论文发出来引发了一批量子物理学家转入ML研究。
但Vision Transformer 2020年出来之后,这条线彻底消失。Transformer的全局attention提供了比张量网络的固定一维拓扑灵活得多的关联结构。张量网络在图像上的固定拓扑反而成了束缚。工程影响极小,今天主要局限在量子化学和材料模拟的特定子领域。主流CV/NLP任务里完全看不到张量网络的身影。
这条线的失败说明一件事:物理上漂亮的结构(描述纠缠态用的MPS)不一定是AI任务上漂亮的结构。Transformer那套"每个token都能关注任意其它token"的全局结构,在表达能力上彻底压过了固定一维拓扑的张量网络。

## 9.3 量子神经网络:在主流 AI 圈基本看不到的孤岛
量子神经网络(Quantum Neural Network,QNN)是物理学派造AI模型的另一条线,更直接地把量子物理搬进来。基本思路是用量子电路(quantum circuit)代替经典神经网络的层,理论上可以利用量子叠加和纠缠加速学习。Google、IBM、微软、Quantinuum这些有量子计算硬件的公司都做过相关研究。
这条线在学术上一直在发文章,arXiv上每年几百篇QNN相关论文。商业上有少数pilot案例(SpinQ跟华夏银行子公司Longying Zhida做ATM调度的QNN,Quantinuum的lambeq在做语义搜索)。但在主流AI圈基本看不到。原因有几条:能用的量子硬件还是NISQ级别(noisy intermediate-scale quantum),量子比特少、噪声大、相干时间短。研究者社区高度依赖单一供应商的SDK,vendor lock-in是QML采用的最大非技术障碍。理论上预期的"量子加速"在大多数ML任务上没被验证出来。
工程影响:基本为零。今天没有任何主流AI产品是基于QNN的。这条线的命运将来取决于通用量子计算什么时候真正落地,跟物理工具本身的优雅程度关系不大。

## 9.4 Hamiltonian Neural Networks:理论漂亮但工程影响小
2019年Sam Greydanus、Misko Dzamba、Jason Yosinski(Google Brain)在NeurIPS发表《Hamiltonian Neural Networks》(arXiv:1906.01563)。核心想法是把哈密顿力学(物理学描述守恒系统的标准框架)写进神经网络架构,让网络在训练时自动学到能量守恒。论文证明在双体问题、单摆这类物理系统上,HNN比普通神经网络训练得更快、泛化更好、时间上完美可逆。
物理上这是个漂亮的工作。哈密顿力学是19世纪以来物理学的核心数学框架,把它嵌进神经网络是个elegant的想法。论文之后几年里也催生了一系列后续工作:Lagrangian Neural Networks、Symplectic Networks、Neural ODE的物理变体等等。
但工程影响很小。HNN和它的后续主要还是在物理模拟、机器人控制、分子动力学这些"系统本身就守恒能量"的窄场景里有用。主流的图像、文本、推荐这些AI任务,输入输出之间根本没有能量守恒的物理结构,HNN没用武之地。今天没有任何主流AI产品是基于HNN的,它停在了"理论上漂亮 + 窄场景有用"的状态。
HNN的失败模式跟张量网络类似:物理上漂亮的结构(哈密顿力学的辛几何)不一定能在AI任务上变成竞争优势。如果数据本身没有那个物理结构,强行把结构写进网络反而是束缚。

## 9.5 这些失败案例的共同模式
把这四个失败案例放到一起,模式很清楚。
它们都严肃。论文质量高,作者是顶级研究者,物理推导扎实。它们也都按7.2节那套流程做:识别数学形状、做玩具模型、跑MNIST对照、写挂物理关键词的论文、投NeurIPS或ICML。这套流程本身没毛病,只是命中率低。
事后看,成功的案例都能找到一种"物理工具结构跟AI任务结构对得上"的故事。Hopfield联想记忆跟自旋吸引子对得上,CNN平移卷积核跟图像平移对称对得上,AlphaFold SE(3) 等变跟分子三维对称对得上,Diffusion加噪去噪跟非平衡过程对得上。失败的案例也能找到反过来的故事:RBM被CNN淘汰是因为CNN在自然图像上的归纳偏置更对路,张量网络在图像上的固定一维拓扑反而是束缚,HNN在没有能量守恒的通用AI任务上没用武之地。
但要诚实承认这种解释有事后诸葛亮的味道。"成功的找匹配、失败的找不匹配"在论证形式上几乎不可证伪,给任何结果都能编出一个"是否匹配"的故事。这套解释帮助理解既有案例,但对未来的预测力很弱。物理学家四十年前不会预料到Hopfield网络在2020年突然被发现跟Transformer attention数学等价复活。
更要承认的是,今天看"失败"的模型未来不一定一直失败。
张量网络在量子计算硬件成熟之后可能复活,因为量子电路本身就是张量网络结构。HNN在AI for Science(分子动力学、物理模拟、可控机器人)这些"任务本身有守恒律"的细分场景里已经在悄悄变得有用,Lagrangian Networks、Symplectic Networks这一系列后续工作还在发。QNN的命运完全取决于通用量子计算什么时候真正落地,跟物理工具本身的优雅程度关系不大。RBM这种半失败的案例如果在某个新场景被重新发现价值,小规模复活也不是没可能。Modern Hopfield在2020年突然跟attention等价的故事就是个典型先例:一个看似过时的物理工具在新架构下被认出来还在跑。
所以这一章列的"失败",只是说截至今天这些模型在主流AI工程界没成主流,不是判它们永远没希望。哪天某个工程师在某个新场景里把张量网络或HNN拿出来重新做一次工程化,把物理标签剥掉、用新的语言重新表述出来,这一章里的某个名字就会移到第八章去。
这套叙事在AI圈里通常只统计分子。媒体讨论"物理在AI里的成功"时不会列举失败案例。研究者写综述时不会回顾那些没改变工程的方向。但失败案例的数量决定了物理方法论真正的边际成本。每一张没中奖的彩票都是一组博士生几年的时间、一笔算力、一个团队的注意力。
# 十、工程化:一个不同的路线
最后一章讲一讲,作者认为下一步物理应该走的路线。这一章是一个提议,不是描述行业正在做的事。如果将来真有人按这条路做出来,再回头看这一章可能是历史的注脚。
## 10.1 演化的逻辑:让模型在生态位里自然竞争
过去十年的"用物理工具造AI模型"的尝试有两种思路。一种是"智能设计"的逻辑,预设一个统一原则(比如对称性),从原则推导出所有架构。这条路径的成败完全取决于"原则是否抓住了AI的核心特征"。事实证明单一原则覆盖不了AI模型的全部多样性。
另一种是演化的逻辑:不预设统一原则,系统地创造大量物理启发的变种,让它们在不同生态位上竞争,让最适合每个生态位的存活。
这条路的核心判断:AI的演进不会靠某一个统一框架解决所有问题。它会靠造出海量的物理启发模型、把它们工程化、然后按不同场合精准匹配。
这条路接近生物进化。生物界没有一个"统一生物原则"指导所有物种该长什么样。物种是在各种环境里独立演化出来的,按生态位匹配。AI模型的演化更接近这个图像。
物理工具箱里有上百个数学骨架可供尝试,7.1节已经列过完整清单(已严肃利用的几族、有早期尝试未成熟的几族、几乎空白的潜在金矿区),这里不重复展开。
## 10.2 工程化意味着什么
工程化不是"发一篇证明某物理概念在玩具模型上成立的论文"。第九章讲的失败案例里大多数都停在了这一步。工程化是走完从物理原理到可工业部署的完整链路:
1. 定义清楚一个物理根族在AI语境下的状态空间、参数化、目标函数
2. 实现为可训练的神经网络架构
3. 在标准benchmark上跑通baseline,与现有主流模型做能力对比
4. 记录它的强项、弱项、失败模式、适用场景
5. 做到"可以被工程师拿去用"的成熟度
扩散模型从Sohl-Dickstein到何宏嘉的那一步是这条工程化路径最干净的标杆案例,完整故事见8.2节。何宏嘉2020那篇DDPM做的核心工作就是把1-5全部走完,让一个"在玩具实验上可行"的物理构想变成了"真实可用的AI工具"。
工程化的核心动作是剥离物理语言。物理学家爱用的术语(变分自由能、非平衡热力学、规范不变性)在ML工程师眼里是噪声。工程化要把这些术语翻译成ML圈内能直接消费的语言(损失函数、训练目标、采样过程)。这件事看起来是表面功夫,实际上是这条路径里最关键的一步。
## 10.3 按场合匹配:AI 不是只需要一个模型
有一个今天AI界的主流叙事需要被质疑:Transformer适用于一切,不需要其他模型了。
事实是Transformer在大多数场合表现强,但有几个场合它并不占优。长序列建模有更高效的state-space models。分子和晶体等科学数据需要等变网络。连续物理系统的生成上扩散模型有难以替代的优势。决策和控制问题Hamilton系统族的能量守恒结构更稳定。结构化表格数据上基于决策树的XGBoost、LightGBM至今没被神经网络打败。这些是系统性的现象,覆盖范围远超过"个别例外"那种程度。
正确的图景是:AI模型库应当像一个工具箱,针对不同问题取不同工具。建立"任务特征→最优物理根族"的匹配体系,是这件事的核心价值之一。
这跟工程师在其他领域的做法一致。后端工程师不会用同一个数据库做所有任务。需要事务用PostgreSQL,需要全文搜索用Elasticsearch,需要key-value用Redis,需要时间序列用InfluxDB。AI模型库应该走同样的方向。
## 10.4 一个知识库的轮廓
要把上面这件事做起来,需要一个结构化的物理AI知识库作为基础设施。形态是按严格结构组织的可查询系统,既不同于描述性的书也不同于松散的文献综述。每个物理根族是一个有固定字段的对象,对象之间有形式化的关系图。
按任务和根族两个维度展开,可以得到三张核心表。
表一:根族 × AI能力。每个根族能催生服务于哪类AI任务的模型。生成(分布建模式:扩散族、Flow Matching)、生成(自回归式:Transformer族)、判别/感知(CNN、等变网络)、决策/策略(Hamilton族、最优控制)、检索(embedding模型)。
表二:根族 × 物理能力。每个根族在物理里本来能描述什么。平衡态(Boltzmann)、非平衡演化(Langevin)、多体相互作用(Ising、Hubbard)、对称性与守恒(群论)、多尺度结构(重整化群)、无序系统(自旋玻璃)、开放系统(Lindblad)、表面生长(KPZ)。
表三:根族 × 转化成熟度。每个根族在AI里的开发程度。已经有成熟AI实例、有早期尝试但还没成熟、几乎空白但有潜力。
这三张表合起来是这个工程的最小可行起点。它们能让"哪里被开发了、哪里没有、哪里是金矿区"一目了然。三张表成形之后,整个工作就从抽象的"建立知识库"变成具体的"把每一个空白格子填满"。
填满空白格子的工作量大,但路径清楚。不再是赌某个物理根族会爆发,是系统地把所有根族都跑一遍。这跟7.2节那套"买彩票"流程的根本区别在于:不再依赖运气和直觉,是按工程方法穷举。
## 10.5 这件事谁来做
这套工作的人才结构有意思,需要三类人共同工作。
第一类,懂物理工具箱深的人。统计物理、凝聚态物理、量子场论训练出来的研究者,知道每个根族在物理里能做什么,能写出严格的数学表述。
第二类,懂ML工程的人。能把数学表述翻译成可训练的神经网络架构,能跑benchmark,能调超参,能把成熟度推到"工程师拿去用"那一步。
第三类,懂任务匹配的人。知道在不同的AI应用场景里,什么样的物理根族可能最合适。这是产品视角,不是研究视角。
这三类人在现在的AI圈里几乎是分开的。物理学家写论文,ML工程师做产品,产品经理决定用什么模型。这个工程要把三者绑在一起做。结构上跟扩散模型从Sohl-Dickstein到何宏嘉到工业部署那条链路一样:物理出原型,工程做简化,产品找场景。
这套工作目前没人在系统做。诚实的状态是:物理→AI这条路在过去四十年是个体研究者各做各的、命中率极低的活动。把它变成一个系统工程是个提议,不是事实。这个提议要兑现,需要至少一个团队同时具备上面三类人才。如果哪一年这事真做起来,再回头看这一章可能是历史注脚。
# 结尾:物理学的第二春
到此,《当物理遇上AI》的下半篇也讲完了。

把上下两篇合起来,物理学在AI里站的四层位置就清楚了:
- 第一层在最底层,贡献了计算的骨架,能量、熵、自由能这些物理数学早就嵌进了AI的训练目标里
- 第二层在中层,塑造了网络的形状,Hopfield的Ising能量函数、CNN的平移对称性、重整化群对应深度网络的层级结构。
- 第三层在上层,提供了理解AI现象的语言,临界标度律、自旋玻璃、亚稳态这些物理工具被借来分析AI的open questions。
- 第四层是方法论层,产生了极少数改变范式的成果,扩散模型是最干净的一例。
第三层值得多说几句。物理用来类比AI现象,AI的open questions里有几个找到了真正的物理意义,物理工具的数学结构跟AI现象的数学结构在形式上能对得上。Scaling Law对应临界标度律,双下降可以用随机矩阵理论严格推导出来,Grokking的亚稳态物理图像也非常贴。这三个证据相对硬。涌现和In-Context Learning这两个证据仍然薄弱,可能只是表面相似。第三层有真东西,但要诚实区分哪些是真同构、哪些只是看起来像。
第四层讲的是物理学家造AI模型这件事。把物理工具箱里的东西搬出来造一个新的AI模型,看会不会成功。过去四十年算下来,真正中过奖的只有三条线:自旋族(Hopfield、Boltzmann机、Modern Hopfield)、对称性族(CNN、AlphaFold)、扩散模型。这三条线背后已经拿了两个诺贝尔奖(物理 + 化学)。没中奖的几百个尝试散在RBM时代、张量网络、量子神经网络、Hamiltonian Neural Networks各处。下一步对的路是把这件事从"个体研究者各自买彩票"变成"系统工程化所有物理工具箱",但这条路目前还只是一个提议,没人真的在做。
这四层加起来,是一个微妙的事实:物理学有真实的贡献,分布在不同层次。有些已经成为AI的地基,连物理标签都消失了。有些还在探索。这是一个比"物理学拯救了AI"或"物理学对AI没什么用"都更接近真相的判断。
物理学作为"研究自然界的学问"走到了边界。半个世纪没有产生标准模型之外的实验突破。但物理学作为一套"面对复杂系统的方法论",没有失效。这套方法论正在从自然界搬家到AI世界,把工具一件一件搬过去,看哪些能在新的对象上重新生根。
搬家还没有完成。那些空白根族(可积系统、Lindblad、KPZ、Hubbard)还没有人认真试过。下一个扩散模型可能就藏在其中某一个里,等着有人把物理原理和工程化简化放在一起,冷了几年之后被另一个人激活。
物理学问了宇宙一遍"当无数个体互相作用,整体会涌现出什么",答案叫统计力学、热力学、相变理论。现在它要问AI同一个问题。这一遍的答案叫什么,还没有人知道。但提问的工具已经在手里。
## 作者其它文章(选)
- 细说美国的华人老钱家族
- 人工智能的工程全景(上):硬件、电力、训练、推理
- 什么是 Diffusion Model?图片视频生成模型全网最详细介绍
- 美国税收制度完全指南
- 当物理遇上AI:深度学习里的物理元素(上)
- 一文看懂美国的法律系统
- 教宗良十四世论人工智能(精华版)
- 廉颇老矣,尚能饭否:现代数学史(下)
- 一篇文章讲清楚美国的移民系统
- 大航海时代2的逆向工程实验
- 量子计算机有前途吗?
- 祖父积分学概论
- 我见青山多妩媚:二十世纪数学史(上)
- 一文讲清楚美国医疗系统
- AI 如何打进美国教育生态?
- 一篇文章看懂美国教育全生态
- 马斯克把 xAI 并入 SpaceX,到底意味着什么?
- Vibe Learning:AI 时代,学习这件事被重新组织了
- 福特经济学和 AI 经济学
- 数学照妖镜:AI 能发现新的数学定理吗?
- 一篇文章讲清大语言模型发展史
- Vibe Reading:AI 时代读书的系统化方法
- 长篇分析:Manus 案折射出的中国 AI 创业生态
- 两万字科普:AI 为什么会编程——原理、历史与未来
- 全网最详细的AI学习路线图
- AI将如何颠覆教育,普通人又应该如何抢夺教育新的生态位
- 学物理的八方英雄们,物理学已死,请转行搞AI
- 兄弟们想清楚:究竟是你为X打工,还是X为你打工?
- 重返星辰大海:这次绕月飞行有意义吗?
## 相关链接
- [snowboat](https://x.com/snowboat84)
- [@snowboat84](https://x.com/snowboat84)
- [1.1K](https://x.com/snowboat84/status/2062686432335184321/analytics)
- [《当物理遇上AI:深度学习里的物理元素(上)》](https://x.com/snowboat84/status/2060145538922844179)
- [什么是 Diffusion Model?全网最详细介绍](https://x.com/snowboat84)
- [细说美国的华人老钱家族](https://x.com/snowboat84/status/2062326581776011623)
- [人工智能的工程全景(上):硬件、电力、训练、推理](https://x.com/snowboat84/status/2061962883651731602)
- [什么是 Diffusion Model?图片视频生成模型全网最详细介绍](https://x.com/snowboat84/status/2061598950944305295)
- [美国税收制度完全指南](https://x.com/snowboat84/status/2060511915617779821)
- [当物理遇上AI:深度学习里的物理元素(上)](https://x.com/snowboat84/status/2060145538922844179)
- [一文看懂美国的法律系统](https://x.com/snowboat84/status/2059795010330251568)
- [教宗良十四世论人工智能(精华版)](https://x.com/snowboat84/status/2059434342745866391)
- [廉颇老矣,尚能饭否:现代数学史(下)](https://x.com/snowboat84/status/2059071134738620606)
- [一篇文章讲清楚美国的移民系统](https://x.com/snowboat84/status/2057980486501433383)
- [大航海时代2的逆向工程实验](https://x.com/snowboat84/status/2057264254319993332)
- [量子计算机有前途吗?](https://x.com/snowboat84/status/2056895775578456417)
- [祖父积分学概论](https://x.com/snowboat84/status/2056533111983493136)
- [我见青山多妩媚:二十世纪数学史(上)](https://x.com/snowboat84/status/2055446902171406761)
- [一文讲清楚美国医疗系统](https://x.com/snowboat84/status/2055081426744422697)
- [AI 如何打进美国教育生态?](https://x.com/snowboat84/status/2054721509420372180)
- [一篇文章看懂美国教育全生态](https://x.com/snowboat84/status/2054359249917210633)
- [马斯克把 xAI 并入 SpaceX,到底意味着什么?](https://x.com/snowboat84/status/2054000682114613488)
- [Vibe Learning:AI 时代,学习这件事被重新组织了](https://x.com/snowboat84/status/2052908751435477046)
- [福特经济学和 AI 经济学](https://x.com/snowboat84/status/2052551731385602072)
- [数学照妖镜:AI 能发现新的数学定理吗?](https://x.com/snowboat84/status/2052174034041995572)
- [一篇文章讲清大语言模型发展史](https://x.com/snowboat84/status/2051444935547912236)
- [Vibe Reading:AI 时代读书的系统化方法](https://x.com/snowboat84/status/2050008577511973253)
- [长篇分析:Manus 案折射出的中国 AI 创业生态](https://x.com/snowboat84/status/2049643679804248305)
- [两万字科普:AI 为什么会编程——原理、历史与未来](https://x.com/snowboat84/status/2048919554882215954)
- [全网最详细的AI学习路线图](https://x.com/snowboat84/status/2047457686070141051)
- [AI将如何颠覆教育,普通人又应该如何抢夺教育新的生态位](https://x.com/snowboat84/status/2044932338262667509)
- [学物理的八方英雄们,物理学已死,请转行搞AI](https://x.com/snowboat84/status/2044584627046920278)
- [兄弟们想清楚:究竟是你为X打工,还是X为你打工?](https://x.com/snowboat84/status/2043842017260908743)
- [重返星辰大海:这次绕月飞行有意义吗?](https://x.com/snowboat84/status/2042405716380835998)
- [Upgrade to Premium](https://x.com/i/premium_sign_up)
- [8:02 AM · Jun 5, 2026](https://x.com/snowboat84/status/2062686432335184321)
- [1,186 Views](https://x.com/snowboat84/status/2062686432335184321/analytics)
---
*导出时间: 2026/6/5 11:14:26*