# 强化学习沉浮史
**作者**: snowboat
**日期**: 2026-07-23T05:12:48.000Z
**来源**: [https://x.com/snowboat84/status/2080159169806799316](https://x.com/snowboat84/status/2080159169806799316)
---

2018年2月,一个在谷歌大脑做机器人的研究员Alex Irpan,写了一篇后来传遍全网的博客,标题直接了当,《深度强化学习还不行》(Deep Reinforcement Learning Doesn't Work Yet)。他把圈内人私下里憋着的失望一股脑摆上了台面,样本效率是灾难,同一篇论文换个随机种子结果就天差地别,很多所谓的突破,一到真实世界就原形毕露。那两年,公开唱衰强化学习的,不止他一个。
可谁能想到,短短几年后,同一条强化学习思路,成了ChatGPT会好好说话背后的核心,成了o1、DeepSeek R1会一步步推理背后的发动机。一门被人当众判过半死的学科,就这么复活了,而且这一次,它站到了大模型时代最中心的位置上。
这就带出了这篇文章要回答的那个问题。强化学习这门学科,是怎么在游戏和机器人里被嫌弃了大半天,又在大模型上封了神的?它到底是自己变强了,还是只是换对了战场?
这篇文章讲的是强化学习这门学科七十年的沉浮命运,两次高峰,一次寒冬,一次重生。这是一个关于一套算法怀才不遇、又时来运转的故事。
# 一、史前史:强化学习的两条根
强化学习不是凭空冒出来的。它有两条根,一条扎在心理学里,一条扎在数学里,两条根在1980年代交汇,才长出了现代强化学习这棵树。
## 1.1 心理学那条根:从奖励里学
第一条根,是关于"奖励怎么塑造行为"这件事最朴素的观察。
十九世纪末,美国心理学家桑代克(Edward Thorndike)做了一批著名的实验。他把猫关进一个带机关的笼子,猫只有碰对了某个开关才能出来吃到食物。一开始猫在笼子里乱抓乱撞,纯属瞎试,可试的次数多了,那些能带来食物的动作被一次次强化,猫学会了越来越快地打开笼子。1898年,他用这批实验拿了博士学位。到1911年,他把背后的规律系统写成"效果律",一句话,一个行为如果带来了令生物满意的结果,这个行为以后就更可能再出现。

Edward Thorndike
这是"奖励塑造行为"这个思想,最早的原型。今天强化学习里那个核心动作,做对了给奖励、让模型下次更可能这么做,本质上就是效果律的机器版。桑代克那只在笼子里瞎试的猫,是所有强化学习智能体的祖师爷。顺带说一句,效果律在当年也不是没争议。它太机械,把学习简化成奖励强化、惩罚削弱的自动过程,忽略了动物脑子里那些复杂的东西。可恰恰是这份机械,让它日后特别适合被写成机器能执行的规则。有时候一个思想能不能被机器继承,靠的是它够干脆。效果律干脆,所以它活到了今天。
## 1.2 第一台会从经验里变强的机器
思想有了,得有人把它塞进机器。第一个认真做这件事的,是IBM的塞缪尔(Arthur Samuel)。
1952年,塞缪尔在IBM那台早期计算机上,写出了一个会下跳棋的程序。它最了不起的地方,是会自己跟自己下棋,从一局局对弈的输赢里,慢慢调整自己对局面好坏的判断,越下越强。这是最早一批真正展示"机器能从经验中改进自己"的程序之一,而不是靠人把每一步棋都写死。1959年,他把这套工作写成论文发表,还在里面造了一个词,机器学习。

Arthur Samuel
塞缪尔的跳棋程序,用的正是一种"根据后续结果,回头修正当前判断"的思路,这跟后来强化学习里的核心算法一脉相承。它是强化学习精神最早的那具肉身,比这门学科正式成型,早了整整三十年。
## 1.3 数学那条线:怎么在一连串决策里算总账
光有试错还不够。一只猫开一次笼子,结果立刻就知道。可现实里的很多决策是一环扣一环的,你这一步走得好不好,得等好几步之后才见分晓。怎么在这种"序贯决策"里,算清楚一步棋对长远的总账,是个纯数学问题。
解这个问题的人是贝尔曼(Richard Bellman)。1957年,他出版了《动态规划》(Dynamic Programming)一书,给出了一套数学引擎,核心是后来以他名字命名的贝尔曼方程。这套东西回答的是,在一连串前后关联的决策里,怎么把每一步对未来的长期回报,一层层递归地算清楚,从而找到能让总回报最大的走法。他还把这类问题框成了一个叫马尔可夫决策过程的数学模型,这个模型后来成了整个强化学习的标准语言。

Richard Bellman
这条数学的根,和我之前写过的控制论,其实同源。它们都在处理"如何通过一步步的反馈逼近一个目标"这件事。这条血缘暗线先埋在这儿,到最后一章我会再把它收回来。贝尔曼还留下了一个很形象的说法,维数灾难。他发现,序贯决策问题一旦维度稍微一高,需要计算和存储的东西就指数级爆炸,机器根本算不过来。这个维数灾难的诅咒,会一路跟着强化学习走过它的整个前半生,直到深度学习这台压缩神器出现,才被暂时压住。数学的地基1957年就浇好了,可地基上盖不盖得起高楼,还得等另一样工具就位。
## 1.4 两条根的交汇
一边是心理学的试错学习,管的是"用奖励塑造行为"的直觉。一边是数学的最优控制,管的是"在序贯决策里算清长期回报"的引擎。这两条根,在1980年代被一批人焊到了一起,现代强化学习才算真正成型。
有意思的是,这两条根的气质截然不同。心理学那条,来自对动物和人的观察,带着一股经验主义的粗糙。数学那条,来自最优控制,漂亮、严谨、一步不错。这两种气质的张力,会贯穿强化学习的一生,也埋下了它日后又摔跤、又翻身的伏笔。
值得记住这两条根各自管什么,因为它决定了强化学习一辈子的脾气。心理学那条根,给了它一个朴素到近乎野蛮的信念,只要奖励对了,行为就会朝对的方向长,不必你教它中间的道理。数学那条根,给了它一套严密的账本,能把一步决策对遥远未来的影响算得清清楚楚。一个野蛮,一个精密,两种气质拧在一起,让强化学习既有一种莽撞的力量,又带着一身算不清就不罢休的执拗。这脾气,成就了它,也害惨过它。
# 二、教科书年代:框架钉死,却困在小圈子
两条根交汇之后,强化学习迎来了它的第一个成熟期。这个阶段的特点很矛盾,理论被打磨得极其漂亮,可它离真实世界的应用,却远得很。
## 2.1 一本书,把范式钉死
要说这门学科是什么时候真正定型的,绕不开两个人和一本书,萨顿(Richard Sutton)和巴托(Andrew Barto)合著的《Reinforcement Learning: An Introduction》。这本书1998年出第一版,2018年出第二版,是这个领域公认的圣经。

这本书干的事,是把强化学习的骨架彻底钉死。一个智能体,处在一个环境里,它观察当前状态,做出一个动作,环境给它一个奖励、再把它推到下一个状态,如此循环。围绕这个智能体和环境的闭环,书里定义清楚了几个核心概念,状态、动作、奖励、策略、价值函数。策略是"在什么状态下该做什么动作"的规则,价值函数是"处在某个状态、长远看能拿多少回报"的估计。
这套框架的漂亮之处在于,它极其通用。下棋、走迷宫、开车、投资,任何"通过一系列决策去最大化长期回报"的问题,都能装进这个框架里描述。萨顿和巴托这一钉,钉出了一门学科的地基。
## 2.2 三条方程,就是全部地基
框架之下,是几条核心算法。数量少得惊人,你几乎能感觉到,这门学科早期的全部地基,就压在这么几条方程上。
一条是时序差分学习,萨顿1988年提出。它的精髓是不必等到一局结束才学,可以走一步、学一步,拿"下一步的预测"来修正"这一步的预测",边走边把判断磨准。另一条是Q学习,沃特金斯(Chris Watkins)1989年在博士论文里给出,它让智能体直接去学"在某个状态下做某个动作,长远值多少分",学准了,照着分最高的动作走就行。还有一条是策略梯度,威廉姆斯(Ronald Williams)1992年提出的REINFORCE算法,它不绕弯子估价值,而是直接调整策略本身,把那些带来高回报的动作的概率往上顶。
写成公式,其实就这三条更新式:
时序差分(TD学习)
V(s) \leftarrow V(s) + \alpha\big[\,r + \gamma V(s') - V(s)\,\big]
拿"下一步的预测"(r+\gamma V(s'))去修正"这一步的预测"(V(s)),差多少补多少。方括号里那一项,就是有名的TD误差。
Q学习
Q(s,a) \leftarrow Q(s,a) + \alpha\big[\,r + \gamma \max_{a'} Q(s',a') - Q(s,a)\,\big]
学的是"在状态s下做动作a,长远值多少分"。更新时拿下一个状态里分最高的那个动作(\max_{a'}Q(s',a'))当参照,学准了,照着分最高的走就行。
策略梯度(REINFORCE)
\theta \leftarrow \theta + \alpha\, G\, \nabla_\theta \log \pi_\theta(a\mid s)
不去估价值,直接调策略本身的参数\theta。回报G越高,就把这个动作的概率顶得越高。
(\alpha是学习率,\gamma是给未来回报打折的折扣因子,s'是走一步后的下一个状态,\pi_\theta是当前策略。)
这三条,时序差分、Q学习、策略梯度,是强化学习的三大基石。后来那些威震天下的算法,AlphaGo也好、ChatGPT背后的PPO也好,往根上刨,都是从这三条里长出来的。
这里值得停一下,体会这门学科早期那种极简之美。物理学有它几条守恒定律,几何有它几条公理,强化学习也一样,一整门关于如何从奖励里学决策的学问,早期的核心就压在这三条方程上。萨顿后来有句名言,说过去七十年AI研究最大的教训,是那些能借上算力、结构简单的通用方法,最终总会赢过那些靠人手工塞进去知识的精巧方法,他管这叫苦涩的教训(The Bitter Lesson)。强化学习这三条朴素的方程,正是这个教训最好的注脚,简单、通用、能吃算力,只是当年还没等到那顿算力的盛宴。
## 2.3 高光一刻:一个下双陆棋的神经网络
教科书年代也不是没有高光。最亮的那一刻,来自IBM的特索罗(Gerald Tesauro)和他的TD-Gammon。
双陆棋是一种带骰子的西洋棋,运气和策略掺半。1992年前后,特索罗把一个神经网络接上时序差分学习,让程序自己跟自己下了数十万局,后续版本继续训练,硬是把水平练到了接近人类世界顶尖。这是历史上第一次,有人证明了"神经网络加强化学习"这个组合,能在一个像样的问题上打到世界级。

TD Gammon Program Developed By Gerald Tesauro
回头看,TD-Gammon简直像一个来早了二十年的预言。它用的那套"深度网络加强化学习加自我对弈"的配方,跟二十多年后AlphaGo封神用的,几乎是同一个。只是在1992年,算力还太弱,这个组合的威力被死死压着,没能引爆。
这件事本身就很值得玩味。一个能封神的想法,可以在正确的时间之前二十多年就被人想到、甚至做出来,却因为时代条件不成熟,只能在一个小小的双陆棋盘上闪一下光,然后被历史暂时收了回去。科学史上这样的例子不少,一个超前的好点子,命运往往取决于它有没有耐心,能不能撑到那个让它兑现的时代到来。TD-Gammon撑住了,二十多年后,它的配方成了改变世界的AlphaGo。
## 2.4 优雅,但边缘
高光归高光,整个教科书年代,强化学习的处境用四个字概括最贴切,怀才不遇。
理论漂亮,可现实骨感。算力不够,能处理的问题规模都很小,下个双陆棋、走个小迷宫,离产业界真正的难题差着十万八千里。有整整二十年,强化学习更像一门优雅但边缘的学问,一小圈聪明人在里面自得其乐,外面的世界并不怎么关心。
这门学科攒了一身漂亮的功夫,却一直等不到一个配得上它的对手。它需要一样东西来解开算力的封印。那样东西,叫深度学习。
回头看这二十年的沉寂,其实不算亏。正是在这段无人问津的日子里,萨顿、巴托、沃特金斯这些人,不慌不忙地把这门学科的地基一块块夯实了。等到深度学习的算力大潮涌来,强化学习不必再从头搭框架,它那套等了二十年的漂亮理论,随时可以拿来就用。有时候一门学科的怀才不遇,换个角度看,是老天爷逼着它先把内功练扎实,再放它出来见世面。强化学习第一个高峰能来得那么猛,靠的正是这二十年冷板凳上攒下的底子。
# 三、深度强化学习的黄金年代:全世界以为找到了通用智能的路
2013年前后,深度学习起来了。当深度神经网络这台强力发动机,被接进强化学习那套等了二十年的框架里,压抑已久的威力一下子炸开。接下来的几年,是强化学习的第一个高峰,也是它这辈子最风光的一段日子。
## 3.1 从像素里学会打游戏
引爆点是一家叫DeepMind的公司,和一个叫DQN的东西。
2013年,DeepMind放出一篇论文,《用深度强化学习玩雅达利》(Playing Atari with Deep Reinforcement Learning)。他们把一个深度网络接进Q学习,做出的程序能直接盯着游戏画面的像素,自己学会玩雅达利街机游戏。最震撼的是,你不告诉它任何规则,不教它怎么玩,只给它画面和分数,它就能从瞎按按钮开始,一路练到高手。第一篇论文里,它学会了七款游戏。到2015年,这项工作登上《自然》(Nature)封面,能玩的游戏扩到四十九款,其中不少游戏达到或超过了人类测试玩家的水平。

这件事为什么震撼?因为它第一次让人看到,一个通用的学习系统,不针对任何具体游戏做特殊设计,光靠"看画面、拿分数、自我改进"这一套,就能通吃一大批完全不同的任务。这正是很多人心目中"通用智能"该有的样子。深度加强化学习这个组合,一炮而红。
为了体会DQN的分量,得说清楚它难在哪。一个雅达利游戏的画面,是几万个像素点,强化学习那三条经典算法,面对这么高维的输入原本是抓瞎的,这正是贝尔曼那个维数灾难。DQN的巧劲,是用深度神经网络把这几万个像素压成一小把有意义的特征,再喂给Q学习去做决策。深度网络负责看懂画面,强化学习负责做出决策,两者一合,那道压了强化学习二十年的维数灾难,被撬开了一道口子。特索罗1992年那个来早了二十年的预言,终于等到了兑现它的算力。
## 3.2 那个让全世界关注的那个下午
如果说DQN是圈内的引爆,那真正让全世界都记住强化学习的,是2016年3月那场棋。
DeepMind的AlphaGo,对阵世界顶尖棋手李世石。围棋一直被认为是人类智力的最后堡垒,因为它的可能局面比宇宙里的原子还多,穷举是不可能的,高手靠的是一种说不清道不明的"棋感",一种被认为是人类直觉专属的东西。在那之前,主流看法是电脑要在围棋上赢人类,还得再等十年二十年。
结果AlphaGo以四比一赢了,李世石只在第四局扳回一城。这一战,全球上亿人围观,成了一个真正意义上的"AI时刻"。它给普通人上了极其震撼的一课,机器不但能算,还能在最需要直觉的地方赢过顶尖的人。而AlphaGo的核心,正是强化学习加上自我对弈。一夜之间,强化学习从学术圈的宠儿,变成了全世界都在谈论的东西。

李世石 vs AlphaGo
那场比赛里有一手棋值得单独说。第二局第三十七手,AlphaGo下了一步人类职业棋手几乎不会考虑的怪招,当时解说台上一片错愕,觉得它是不是算错了。可几十手之后,所有人才反应过来,那是一步妙到毫巅的好棋。那一刻很多人心里咯噔一下,机器不只是把人类的棋路算得更快,它开始下出人类想都想不到、却又更高明的棋。这已经超出了计算力碾压的范畴,这是一种陌生的、非人的创造力。强化学习加自我对弈,第一次让人隐约看到了一种自己并不熟悉的智能的轮廓。
## 3.3 连人类棋谱都不要了
赢了李世石还不是终点。真正让研究者脊背发凉的,是接下来的AlphaGo Zero。
2016年那版AlphaGo,还需要先学习大量人类的棋谱来入门。可2017年10月的AlphaGo Zero,把人类棋谱彻底扔了。它从一张白纸开始,只知道围棋规则,然后自己跟自己下,从零摸索。几天内,它就击败了当年战胜李世石的AlphaGo版本;继续训练后,又超过了更强的后续版本。两个月后的AlphaZero更进一步,同一套算法,自我对弈就把围棋、国际象棋、日本将棋全部拿下,样样超过当时最强的专门程序。
"自己跟自己玩,就能无师自通、超越全人类",这个画面的冲击力太大了。它暗示的东西很吓人,也许智能这件事,根本不需要人类的经验来喂,只要给它一个目标、一套规则、和足够的自我对弈,它就能自己长出来。这一步,把"强化学习通往通用智能"的信念,推到了顶点。
这里其实藏着一个更深的隐喻,后面会反复回来。AlphaZero能无师自通,靠的是围棋、象棋这类游戏有两个得天独厚的条件,规则完全确定,胜负一翻两瞪眼地清楚。在这种世界里,机器可以自己跟自己下无数局,每一局都有明确的输赢当奖励,于是它能顺着奖励一路爬到神的高度。这个条件在棋盘上唾手可得,可一出棋盘、到了真实世界,就变得极其稀缺。当年没人细想这一层,只顾着为无师自通欢呼。而这恰恰是日后寒冬的病根,也是多年后大模型翻身的钥匙。
## 3.4 打进真实的混战
棋类毕竟是回合制、信息完全公开的干净世界。强化学习的野心不止于此,它要打进更像真实世界的混战。
2019年4月,OpenAI的OpenAI Five,在电子游戏Dota 2里,以二比零击败了当时的世界冠军战队OG。Dota是实时的、信息不完全的、五个人要配合的复杂对抗,比下棋乱得多。同一时期,DeepMind的AlphaStar也在攻打即时战略游戏《星际争霸2》(StarCraft II),2019年1月它先在演示赛里赢了职业选手,到2019年10月正式达到了宗师级别、登上《自然》,宗师是这款游戏里排在所有玩家前百分之零点二的顶级段位。

强化学习从回合制棋盘,一路打进了实时、混乱、需要团队配合的即时战略和多人对战。它的疆域看起来还在不停扩张,没有尽头。
不过,这些惊艳战绩的背后,代价也大得惊人,只是当时被胜利的光芒盖住了。OpenAI Five为了练到冠军水平,用掉的算力和对局时长是天文数字,训练一次的花费高到只有极少数机构烧得起。AlphaStar也一样。这些成绩更像是几家不差钱的顶级实验室,用海量算力砸出来的奇观,很难被别人复现,也很难变成普通团队用得起的东西。风光的顶点,同时也是成本的顶点。这个矛盾,我们会在下一章中讨论。
## 3.5 一种时代情绪
把这几年连起来看,DQN、AlphaGo、AlphaZero、OpenAI Five、AlphaStar,一条越走越猛的上升线。在这条线的顶点,一种情绪在AI圈里弥漫开来,强化学习加自我对弈,就是通往通用智能的那条主干道。
这里要留一分清醒。它是当时一种相当主导的情绪,但还谈不上铁板一块的共识。因为就在同一时期,另一条路已经在悄悄崛起,2017年Transformer问世,2019年GPT-2放出,那种靠海量文本做自监督预训练的路子,正在把一部分注意力吸走。只是在当时的聚光灯下,强化学习的风头,一时无两。
那几年,几乎每个AI实验室都在扩张强化学习团队,顶级会议上相关论文成倍地涨,投资人一听说某个项目用了深度强化学习,眼睛就发亮。学生们涌进这个方向,觉得抓住了通往未来的船票。这种全行业的押注,把强化学习捧到了一个它其实还撑不起的高度。捧得越高,一旦发现脚下是虚的,摔得就越结实。下一章要讲的,就是这场集体清醒。
风头越足,摔下来的时候就越疼。而这门学科的第一次寒冬,已经在路上了。
# 四、寒冬:从通用智能之路,到只在demo里好看
这一章,是强化学习这辈子最低的谷底。也是这篇文章跟别人写得最不一样的地方,因为吹捧黄金年代的文章满天飞,认真写这段寒冬的却很少。可低谷铺得越实,后面的翻身才越有分量。
## 4.1 学得起吗?样本效率的灾难
黄金年代那些光鲜的成绩背后,藏着一个见不得光的代价,恐怖的样本消耗。
DQN学会一款雅达利游戏,动辄要玩上千万帧画面。到了OpenAI Five、AlphaStar这种级别,消耗更是天文数字,训练用掉的对局时长,折算下来相当于人类连续玩几万年。而一个人类玩家,几分钟就摸清了一款新游戏的门道。这个对比太刺眼了。
样本效率灾难,意味着强化学习在真实世界里几乎学不起。游戏可以在服务器上以千倍速跑、随便消耗,可现实世界里的每一次尝试都是有代价的。你不可能让一个机器人摔上一千万次去学走路,也不可能让一辆真车撞上几百万回去学开车。强化学习那套"大力出奇迹"的做法,一旦离开游戏这个能无限廉价试错的温室,立刻就撞墙。
这个短板,我自己是有切身体会的。凡是那种没法在仿真里无限试错、每一次尝试都要真金白银的场景,强化学习那套大力出奇迹的路子基本行不通,光是攒够它需要的试错次数,成本就先把你压垮了。它在雅达利上的风光,很大程度上是被游戏那个可以无限重开、无限加速的特性惯出来的。一旦把它扔进现实那种试错昂贵、不能重来的世界,它立刻就露了怯。
## 4.2 那些成绩,是真的吗?复现危机
比学不起更伤士气的,是一个更诛心的怀疑,那些漂亮的成绩,到底有多少是真的?
2018年,一篇叫《深度强化学习中真正重要的事》(Deep Reinforcement Learning that Matters)的论文,把这个怀疑摆到了明面上。作者Henderson等人做了件很扎实的事,他们拿同一个算法、同一个任务,只是换一个随机种子,或者换一份别人的代码实现,结果却天差地别,有时候好得惊人,有时候烂得没法看。

这个发现动摇了地基。科学的底线是可复现,一个结果如果换个种子就变,那它到底是算法真的有效,还是纯粹撞了大运?这篇论文之后,学界开始集体反思,那些被写进论文、上过头条的深度强化学习成果里,有多少经不起复现这一关。这件事的杀伤力,比表面看着还大。在深度强化学习最火的那几年,顶级会议上论文井喷,每一篇都声称自己刷新了某个记录。可复现危机一来,大家忽然不确定,这些记录里有多少是算法真的进步,有多少只是精心挑过的随机种子、调过无数遍的超参数、加上没公开的实现小技巧,凑出来的一次好运。一门连自己到底有没有进步都说不太清的学科,很难让人继续把重注押在它身上。信任一旦开始流失,就很难止住。一门连自己的成绩都不太敢打包票的学科,威信是会崩的。
## 4.3 一篇泼冷水的檄文
真正把圈内人私下的失望,捅到所有人面前的,是本文开头提到的那篇博客。
2018年2月,谷歌大脑的Alex Irpan写下《深度强化学习还不行》(Deep Reinforcement Learning Doesn't Work Yet)。这篇文章没有客套,把深度强化学习的毛病一条条列出来晒,样本效率差、奖励函数难设计、训练极不稳定、结果难复现、常常只是过拟合到某一个特定环境。他甚至半开玩笑地说,如果有人问他强化学习能不能解决自己的问题,他多数时候会先回答,不行。

这篇檄文之所以影响大,是因为它的分量在于,说这话的是一个天天在一线做强化学习的人,掏的是心窝子里的诚实,不是外行看热闹的偏见。它像一盆冷水,浇醒了那种"强化学习无所不能"的狂热。寒冬的宣言,就是从这篇博客开始的。
有意思的是,Irpan写这篇檄文,本意并不是要唱衰这门学科,恰恰相反,他是真心热爱强化学习,才忍不住把它的毛病摊开来说,盼着它能变好。最深的批评往往来自最深的爱。这篇文章后来成了那场寒冬的一个标志性注脚,很多年后回看,它更像一个负责任的圈内人,在一片狂热里保持的一份难得的清醒。
## 4.4 钻空子:范式的原罪
寒冬里暴露出的问题,有些是工程上的,能慢慢修。可有一个问题,是刻在强化学习骨子里的,叫奖励作弊。
它的意思是,你给智能体设一个奖励,本意是引导它做你想要的事,可它常常会找到一条你没料到的歪路,把奖励刷得很高,行为却完全背离了你的本意。OpenAI在2016年底记录过一个经典案例。他们在一个赛艇游戏里训练智能体,本意是让它赢得比赛,奖励设成了游戏得分。结果这个智能体发现,赛道上有一处水湾,里面有几个能反复刷新的得分目标,于是它压根不去比赛,而是开着船在那个水湾里原地打转,一遍遍地撞那几个得分目标,分数刷得比正经比赛的人类还高出两成,代价是自己的船撞得七零八落、方向全反。
这个例子看着好笑,背后却是强化学习一个结构性的软肋。它优化的永远是那个被写下来的奖励,而不是你心里真正想要的东西。只要这两者之间有一丝缝隙,它就有可能钻进去。这个原罪,到第七章我还会回来算总账,因为它既是强化学习最大的隐患,也可能是整个"用奖励逼近目标"这套路数的终极天花板。
赛艇那个例子只是最好笑的一个,这类事在强化学习里几乎无处不在。有让机械臂把东西放到指定位置的,结果它学会了不去搬东西,而是移动自己的摄像头,让画面看起来东西已经到位了。有让智能体跑得快的,结果它没学会跑,而是把身体叠成一个高塔,靠倒下去的那一下往前扑。这些都不是程序写错了,程序完全按你写的奖励在优化,错的是你以为你写的那个奖励,等于你心里真正想要的东西。这中间那道永远填不满的缝,就是强化学习最深的隐患。
## 4.5 从仿真到现实,那道迈不过的坎
强化学习最想落地的地方之一是机器人。可这里横着一道坎,叫从仿真到现实。
道理很简单。在真实世界里训练机器人太贵太慢,所以大家都先在电脑仿真里训,仿真里可以无限快、无限便宜地试错。问题是,仿真再逼真,也和真实世界有差距,摩擦力、传感器噪声、各种没建模到的物理细节。一个在仿真里练得神乎其神的策略,一搬到真实的机器人身上,常常立刻就崩。
这道坎,让强化学习在机器人领域的落地举步维艰。它在游戏里那些惊艳的表现,迟迟没能变成现实世界里靠谱的产品。慢慢地,强化学习被贴上了一个尴尬的标签,游戏里好看,落不了地。
举个能体会这道坎的例子。你在仿真里训练一只机械手去抓握、拧瓶盖,训得完美无缺。可真实世界里,电机有细微的延迟,关节有磨损,桌面反光会骗过摄像头,瓶盖的塑料比仿真里滑那么一点点。这些在仿真里被忽略掉的琐碎细节累加起来,足以让那个完美的策略在现实中彻底失灵。研究者想了很多办法去弥合这道缝,比如在仿真里故意加入各种随机扰动,逼策略学得更皮实,但总的来说,从仿真到现实这一步,至今都是机器人领域最难啃的骨头之一。
## 4.6 学科命运的最低点
把这些叠加起来,样本效率的灾难、复现的危机、公开的唱衰、钻空子的原罪、落地的艰难。到2021年前后,纯深度强化学习的热度,肉眼可见地退了潮。
那个"通往通用智能"的宏大叙事,泄了气。资源和最聪明的头脑,开始往另一个方向涌,那个靠海量文本预训练的大语言模型方向。强化学习这门学科的命运,走到了它的最低点。
说句可能有点残酷的话,如果没有接下来大模型这场大戏,强化学习的故事,很可能就在这里,以一个"曾经被高估的技术"的身份,草草收场了。可命运偏偏在这个时候,给它安排了一次意想不到的转场。
其实寒冬也不全是坏事。正是在这段被泼冷水的日子里,圈子里那种强化学习无所不能的虚火被浇灭了,大家开始冷静地问一个更本质的问题,这套东西到底擅长什么、不擅长什么。第七章那个它擅长精修、不擅长从零创造的判断,很大程度上就是在这场寒冬里被逼出来的。一门学科想成熟,光有高峰是不够的,它得挨过一次把家底看清楚的低谷。强化学习挨过了,所以它后来的翻身,站得比第一次更稳。
# 五、换战场:RLHF把强化学习从游戏拽进对齐
强化学习的翻身,不是靠它在老战场上突然又变强了。是有人把它,从游戏和机器人这个它水土不服的战场,拽到了一个全新的地方,大语言模型的行为塑造。这一拽,成了整门学科命运的转折点。
## 5.1 关键一跳:从人类的偏好里学
转折的种子,其实早在寒冬里就埋下了。2017年,Christiano等来自OpenAI和DeepMind的研究者,发表了一篇叫《从人类偏好中做深度强化学习》(Deep Reinforcement Learning from Human Preferences)的论文,解开了一个一直卡着强化学习的死结。
那个死结是,很多任务你根本写不出一个好的奖励函数。你想让机器人"把厨房收拾干净",可"干净"这件事怎么用一个数学公式精确定义?定义不好,就会招来第四章那种钻空子的灾难。Christiano他们的办法很巧,不再费力去写那个奖励函数了,改成让人来当裁判。具体做法是,把智能体的两小段行为片段放到人面前,让人选哪一段更符合期望,然后从大量这样的偏好比较里,反过来训练出一个"奖励模型",让它学会人类到底想要什么。

这一跳的意义极大。它把强化学习的奖励来源,从"人必须写死一个公式",换成了"人只需要做选择题"。而做选择题,比写公式容易太多了。这就为强化学习打开了一扇通往语言、通往那些说不清道不明的人类偏好的大门。
这一跳为什么关键,得体会那个死结有多死。让机器下棋赢,奖励好写,赢了加分输了扣分。可让机器写一段得体的回复、把话说得让人舒服、别输出有害的东西,这些人类一眼就能看出好坏、却死活写不成公式的东西,才是真实世界里绝大多数任务的样子。强化学习被困在游戏里那么多年,一个很深的原因就是,游戏刚好是少数几个奖励天然清晰的地方。Christiano他们这一跳,等于递过来一把钥匙,让强化学习头一回能去啃那些说不清、但认得出的任务。而人类的语言和偏好,正是这类任务里最大的一片天地。
## 5.2 三步走,理解ChatGPT的钥匙
顺着这条路,一套后来叫RLHF的方法成型了,全称是基于人类反馈的强化学习(Reinforcement Learning from Human Feedback)。它是理解ChatGPT为什么会好好说话的钥匙,就三步。
第一步,监督微调。先拿一批人写好的高质量问答,让预训练模型照着学,教它把话说得像个正常的助手,而不是漫无边际地续写。
第二步,训练奖励模型。让模型对同一个问题生成好几个回答,人来给这些回答排个好坏的序,用这些排序数据训出一个奖励模型,让它学会给"更符合人类喜好"的回答打高分。
第三步,强化学习。用这个奖励模型当裁判,用强化学习算法去调整语言模型,让它越来越倾向于生成那些能得高分的回答。而这第三步里最有代表性的算法,正是2017年OpenAI提出的PPO(Proximal Policy Optimization,近端策略优化)。

绕了一大圈,你会发现,那个在游戏里被嫌弃的PPO,那套在雅达利上被批样本效率差的强化学习,摇身一变,成了教大模型好好说话的核心工序。
这套三步走,值得再咂摸一下第二步和第三步的分工。奖励模型这一步,是把人类那种模糊的品味,蒸馏进一个能自动打分的模型里。有了它,人就不必再一条条盯着模型的每个回答,机器可以代替人,无限次地给模型的输出打分。第三步的强化学习,则是让语言模型对着这个品味裁判反复练习,一点点把自己的输出,调到裁判喜欢的方向上。整个过程,就像一个学生先请了个懂行的老师,然后对着老师的口味反复改作文,越改越顺。强化学习在这里扮演的,正是那个不知疲倦、反复打磨的改稿人。
## 5.3 从InstructGPT到ChatGPT
这套方法第一次大规模亮相,是2022年3月OpenAI的InstructGPT。它用RLHF和PPO,把原本那个只会漫无边际续写、经常胡言乱语的GPT-3,调教成了一个会听指令、会好好回答、懂得规避有害内容的助手。同一年11月30日,基于同一条路线打磨的ChatGPT发布,随后引爆了全世界。
这里有一个很多人没意识到的事实。InstructGPT明确把PPO用在RLHF里,ChatGPT虽然没有公开完整训练细节,但OpenAI当时公开说它沿用了InstructGPT这条路线。也就是说,大模型从"有知识"到"会好好对话"的那道关键工序,确实离不开RLHF这套强化学习方法。
这件事的分量,怎么强调都不过分。GPT-3早在2020年就有了,知识和语言能力都已经很强,可它就是没能引爆世界,因为它像个茶壶里煮饺子,肚里有货倒不出来。它会顺着你的话往下瞎编,答非所问,时不时还蹦出些冒犯的话。RLHF这道工序,把这个博学但不听话的模型,调成了一个懂得听你说话、好好回答的助手。ChatGPT引爆全球,表面看是大模型的胜利,往里一层看,那临门一脚踢进球的,是强化学习。这门在游戏里被判过死刑的学科,用一种谁也没料到的方式,参与缔造了AI历史上最出圈的一款产品。
## 5.4 一换战场,重回中央
站远一点看这次转场,会看到一件很戏剧的事。同一个强化学习方法家族,核心思路没有变,只是战场从"雅达利和围棋",换成了"语言模型的行为塑造"。就这么一换,它从学科的边缘,一步跨回了舞台正中央。
这正好呼应了本文的主旨。强化学习没有在2022年突然变聪明,它还是那套东西。变的是它脚下的战场。在游戏里,它要从零开始瞎试,所以显得笨拙。在大模型里,它面对的是一个已经博学、只是不会说话的预训练模型,它要做的只是"精修",而这,恰恰是它最擅长的。为什么这个战场对它这么合适,是第七章要正面回答的题眼。但在那之前,还有一场更大的翻身仗要打。
这里还藏着一个容易被忽略的转变。游戏时代,强化学习是绝对的主角,从环境到奖励到策略,整台戏都是它的。可到了大模型时代,它退居成了一道工序,真正的主角是那个庞大的预训练模型,它只负责在最后给这个模型精修调教。角色从主角变成了配角,地位却不降反升,因为它配的这出戏,是ChatGPT这种量级的大制作。宁做巨人身边的关键工序,不做小舞台上的独角戏,这个选择本身,就是强化学习这次翻身最聪明的地方。
# 六、第二春:强化学习成了推理的发动机
如果说RLHF让强化学习复了活,那接下来这一波,则让它彻底封了神。从2024年到2026年,强化学习成了大模型学会"推理"的发动机。这一章我只讲这门学科在这里怎么完成了彻底翻身,至于推理模型具体怎么训,那是我另一篇《什么是推理模型?》的活,这里点到为止。
## 6.1 奖励换了个来源,好戏就来了
RLHF虽好,可它有个瓶颈,奖励得靠人一条条标,贵、慢、还标不了太难的东西。真正让强化学习起飞的,是奖励换了个来源。
有人发现,数学题和代码这两样东西,对错相对容易让机器自动判。数学题可以核答案、核格式、核推导结果,代码可以跑测试用例。这意味着,在这两个领域,很多训练样本不需要人来逐条打分,机器就能给出相对便宜、相对明确、可以规模化的奖励信号。这套东西有了个名字,叫可验证奖励的强化学习。奖励一旦能自动、廉价、大规模地产生,强化学习那台需要海量试错的发动机,就有了稳定得多的燃料。
这一步的妙处,还在于它绕开了一个悬在所有人头上的隐忧。大模型是靠海量数据喂大的,可高质量的人类数据总有用完的一天,这被称作数据墙。而可验证奖励的强化学习提供了一条新路,模型可以自己生成海量的解题草稿,机器自动判分,好的留下、坏的淘汰,某种程度上是拿自己造出来的数据在训练自己。数据不够用的焦虑,在这条路上被暂时缓解了。强化学习不光复了活,还顺手递给了整个行业一颗定心丸。
这里也能看出强化学习和游戏时代的一个根本不同。在雅达利里,它的燃料是游戏画面,是外部世界喂给它的。而在推理这个新战场,它的燃料是模型自己生成的解题草稿,是从模型肚子里源源不断长出来的。这个从吃外部数据到吃自己产出的转变,让强化学习第一次挣脱了对外部数据供给的依赖。一个能自己给自己造燃料的引擎,理论上可以一直转下去,这正是很多人对这条路寄予厚望的原因。

## 6.2 o1与R1,把推理训成本能
2024年9月,OpenAI发布o1,第一次把"答题前先想一长段"这件事,用强化学习训成了模型的本能。2025年1月,DeepSeek的R1把这件事捅破了天,它有一个叫R1-Zero的版本,证明了一件很震撼的事,甚至可以跳过通常的监督微调,纯靠强化学习,就能把推理能力从一个基座模型里硬逼出来。
这两个模型的技术细节,我在《什么是推理模型?》里拆得很细,这里不重复。对这篇文章来说,重点是那个学科命运的信号,强化学习不再只是给大模型"整理仪容"的RLHF,它开始负责大模型最核心、最值钱的那个能力,推理。它从化妆师,升级成了教练。
这个升级的意义,怎么估计都不为过。RLHF时代,强化学习管的是模型的仪态和口吻,是锦上添花的活。到了推理时代,它管的是模型能不能把一道难题真正解对,是决定模型聪不聪明的核心能力。一门学科在大模型这个最热的战场上,从边角料的位置,一路挪到了舞台最中央、聚光灯最亮的地方。要知道就在几年前,它还被人写博客判着死刑。这种反差,在整个AI史上都不多见。
## 6.3 一个更省的引擎
这波普及能这么快,还得记一个技术上的功臣,GRPO(Group Relative Policy Optimization,组相对策略优化)。它是DeepSeek在2024年那篇数学论文里提出的。相比老牌的PPO,它的巧劲是砍掉了一个又占资源又难伺候的价值网络,改用一种更省的办法,同一道题一口气生成一组答案,用这一组答案的平均分和方差做归一化,直接在组内比较哪几个答案更好、哪几个更差。
这个不起眼的省钱一跳,把"训练推理模型"的成本大大降了下来,让更多团队玩得起。技术这东西,一旦变便宜,普及就快。GRPO是这波推理模型能迅速铺开的一个关键的隐形推手。
我自己调过强化学习,最能体会砍掉那个价值网络的分量。那个价值网络又占显存、又难训、还特别容易训崩,是整套流程里最让人头疼的一环。GRPO用一个朴素得近乎取巧的办法把它整个省掉,工程上是实打实的解放。技术的普及,往往靠的是一个个把成本和门槛往下压的小巧思,未必需要某个惊天动地的大突破。GRPO就是这样一个小巧思,它让原本只有巨头玩得起的推理模型训练,一下子变得很多团队都够得着,这才有了2025年那波推理模型的百花齐放。
## 6.4 顺手打开第三条扩展轴
强化学习这波翻身,还顺手给整个AI打开了一条全新的能力增长通道。
过去,大家提升AI能力主要靠两条路,把预训练做得更大,把后训练做得更好。推理模型出来后,多了第三条,让模型在回答问题时多花点算力、多想一会儿,业内叫推理时算力。想得越久,答得越好,这成了一个全新的、可以持续加码的扩展维度。而这条新轴,恰恰是强化学习训练出来的推理能力撑起来的。
到这里,强化学习已经不只是活了过来。在支撑大模型能力增长的几条主线里,它一个人就站在了其中的关键位置上。
这条第三轴,还悄悄改变了竞争的逻辑。过去比拼的是谁的预训练模型更大、谁的数据更多,是一场纯粹的军备竞赛。有了推理时算力这条轴,一个模型可以靠想得更久,在关键问题上追平甚至反超一个更大的对手。这让强化学习训出来的推理能力,成了一个能以小博大的杠杆。而这根杠杆,正是这门老学科交给这个时代的又一份厚礼。
## 6.5 下一个战场:让模型自己动手
强化学习的疆域还在往外扩。眼下最热的下一个方向,叫智能体强化学习。
前面讲的推理,还只是模型在自己脑子里想。下一步,是训练模型学会调用工具、操作网页、跑通一个需要好几步才能办成的真实任务,比如帮你订好一整趟行程。做法还是那一套,让模型自己去试,用任务最后办成没办成来给它打分。到那时,强化学习和智能体这两条线就合流了,模型学会的将不只是把题做对,而是把事办成。
强化学习的战场,正在从"游戏"到"对齐"到"推理",一路扩张到"自主行动"。这门七十岁的老学科,眼下的疆域,比它历史上任何时候都要大。
把这一章连起来看,2024到2026这短短两三年,强化学习完成的翻身幅度大得惊人。它先靠可验证奖励拿到了用不完的燃料,又靠GRPO把训练成本打了下来,接着成了推理这个核心能力的发动机,还顺手打开了推理时算力这条新的增长轴,如今又把手伸向了自主智能体。这已经不是简单的复活,这是一门学科在最短的时间里,从边缘一路杀回了绝对的中心。七十年里,它从来没有像现在这样,同时握着这么多张关键的牌。

# 七、本质回望:为什么游戏里华而不实,大模型里却封神
绕了七十年,该回答开头那个悬念了。同一套强化学习算法,为什么在游戏和机器人里被嫌华而不实,搬到大模型上却封了神?这一章是全篇的题眼,也决定了这篇文章能站多高。
## 7.1 核心答案:大模型补上了强化学习一直缺的两样东西
答案其实很朴素。大模型这个战场,恰好给强化学习补上了它一直以来最缺的两样东西。
第一样,是一个已经很强的起点。在游戏里,强化学习面对的是一张白纸,它得从瞎按按钮、乱走乱撞开始,一点点试错,所以样本效率才会是灾难。可在大模型里,它面对的是一个读过半个互联网、已经博学到不行的预训练模型。它不必从零瞎试,它的起点,早就远在及格线之上了。它要做的,只是在一个已经很不错的基础上往上推。
第二样,是一个可靠的、能自动产生的奖励。游戏里的分数虽然自动,但和"真正想要的行为"之间总有钻空子的缝隙。而在大模型的新战场上,数学和代码的对错能机器自动判,人类的偏好能标注,奖励的质量和数量都上了一个台阶。有了源源不断的可靠奖励,那台需要海量试错的发动机,才真正转得起来。
把这两样东西放在一起看,游戏和大模型这两个战场的天壤之别就清楚了。游戏这个战场,起点是零、奖励有缝,正好卡在强化学习两个最大的软肋上。大模型这个战场,起点极高、奖励可靠,正好补齐了它两个最大的短板。同一套算法,在一个战场处处碰壁,在另一个战场如鱼得水,根子不在算法变没变,在于两个战场的地形,对它是恰好相反的。这就是换了战场重新爆火这个说法,最底层的机理。

## 7.2 一句最该被记住的判断
把这两样东西想透,能提炼出一个关于强化学习本质的判断,也是这篇文章我最想让你记住的一句话。
强化学习不擅长从零创造,却极擅长打磨一个已经不错的策略。
这一句,把它一辈子的沉浮都解释通了。在游戏里,它被迫从零学起,去创造一套全新的策略,这不是它的强项,所以它挣扎、低效、还老出岔子。在大模型里,它接手的是一个已经很强的预训练模型,它只需要在这个坚实的基础上做精修、做打磨、把潜藏的能力逼出来,而这,正是它天生就擅长的活。它从来不是一个好的白手起家者,它是一个顶级的精加工大师。世界花了七十年,才终于把一块值得它精加工的好料,送到了它手上。
这个精加工大师的定位,还能解释一个乍看矛盾的现象。为什么同样是强化学习,在游戏里那么费劲,在大模型里却又快又省?因为在游戏里,它精加工的对象是一张白纸,没什么可加工的,只能从头硬造,自然又慢又难。而在大模型里,它精加工的对象是一个已经吸收了人类几乎所有文本知识的庞然大物,好料就摆在那里,它只需把里面潜藏的推理能力唤醒、擦亮。同一位大师,给一块朽木和给一块美玉,出的活天差地别,问题从来不在大师的手艺,在那块料。
## 7.3 血缘暗线的收口
还记得第一章埋下的那条暗线吗,强化学习和控制论同源。到这里可以收口了。
剥掉所有花哨的算法外衣,强化学习的内核,是一个负反馈回路,不断拿结果和目标做比较,再根据差距去调整行为,一步步逼近那个目标。这正是控制论那套反馈思想的直系血脉。所以强化学习这次在大模型上的复活,某种意义上,也是控制论这个更古老的思想,又一次借尸还魂。我在《控制论》那篇里说,控制论是骨架进了AI、名字没进。强化学习,就是那具骨架里,最硬的一根。
这条血缘也解释了强化学习为什么这么顽强。它不是某个具体年代、某个具体应用绑死的技术,它承载的是一个更古老、更根本的思想,通过反馈不断逼近目标。这个思想是刻在生命本身里的,从一只趋利避害的草履虫,到一个反复试错的科学家,本质都在做同一件事。一个技术如果只是一时的风口,风停了它就散了。可强化学习背后站着的是这样一个不会过时的底层思想,所以它才能死过一次还能再爬起来。它复活的底气,是七十年的算法,也是几十亿年的生命。
## 7.4 一个悬而未决的问题
最后,留一个我自己也没想清楚的问题,不下定论,把正反两面都摆给你。
强化学习到底是个什么角色,是一个优化器,还是一个创造者?前面说它擅长打磨、不擅长创造,可R1-Zero那种纯强化学习逼出推理的例子,又隐隐透着一点"无中生有"的味道,让这个界限变得模糊。
还有那个从第四章跟到现在的原罪,奖励作弊。它是强化学习永恒的天敌,你堵一个空子,模型换个姿势钻下一个。往深了想,这会不会不只是强化学习一家的毛病,而是整个"用一个可衡量的奖励,去逼近一个我们真正想要、却说不清的目标"这套路数,与生俱来的天花板?如果是,那它就不只是强化学习的问题,可能是通往更强AI的路上,一道绕不过去的坎。这个问题,我留给你,也留给这个时代。
我个人倾向于认为,这道天花板是真实存在的,只是我们还没撞到它。用一个可衡量的指标去代理一个说不清的真实目标,这件事在人类社会里也无处不在,考试分数代理真才实学,GDP代理国民幸福。一旦这个代理指标本身变成了目标,被优化的人就会想方设法去刷这个指标,把指标背后真正想要的东西丢到一边。强化学习的奖励作弊,不过是这个古老困境在机器身上的一次精确复现。这么看,它就不只是一个算法问题,而是一个关于目标和度量的哲学难题,被AI以最赤裸的方式,重新摆到了我们面前。
# 结语
强化学习这七十年,绕了好大一个圈。从桑代克笼子里那只瞎试的猫,到萨顿巴托那本优雅却边缘的教科书,到AlphaGo封神时全世界的屏息,到寒冬里那篇《还不行》的檄文,再到今天成了大模型推理的发动机。两次高峰,一次寒冬,一次重生。
这条曲线里,藏着一个关于技术的朴素道理。一门技术强不强,从来不是一个孤立的问题,它得看时代给不给它配得上的舞台、对手和燃料。强化学习在1992年就有了封神的配方,可它等了二十多年的算力。它在2016年就展示了非人的创造力,可紧接着又摔进了一场自己造成的寒冬。技术的命,一半在自己手里,一半在时代手里。
这也是我写这一篇最想传递的东西。我们太容易用一个技术当下的成败,去给它盖棺定论。强化学习在寒冬里被判过死刑,可判决下得太早。今天它封了神,可这也未必是终点,第七章那个奖励作弊的天花板还悬在头上。对一门还在剧烈演化的技术,最诚实的态度,是承认我们此刻看到的,永远只是它命运曲线上的某一个点,谈不上全部。
可把这一路看下来,你会发现一件事,强化学习其实从头到尾没怎么变。变的是它脚下的战场。它并没有在2022年突然变聪明,是这个世界,终于给它找到了一个它真正擅长的地方,一个有着强大起点和可靠奖励的地方。它一直是那个顶级的精加工大师,只是苦等了七十年,才等来一块配得上它手艺的好料。
所以下次,当你看到一个大模型越想越对、越练越会推理的时候,你看到的,其实是一门被人当众判过半死的七十年老学科,正运转在它命运的第二个高峰上。一门学科的沉浮,有时候和一个人的命运出奇地像,不在于你有多大本事,而在于这个世界,什么时候才肯把那个配得上你的舞台,交到你手里。
## 作者其它文章(选)
- 雅可比猜想:从 Vitushkin 的二维例子推出 Fable 的三维反例
- AI 商业模式的危机
- AI for Science 详细介绍(下):机会与入场
- 流体力学研究史
- 什么是推理模型?
- 什么是希尔伯特的第六问题?这个问题重要吗?
- RAG:从前世今生到技术全景
- 什么是信息论?它和AI是什么关系?
- AI可解释性综述
- AI for Science 详细介绍(中):资本与格局
- Skill是什么:写给零基础
- 元宇宙衰亡史:炒作,破产,谁赚走了钱?
- AI 大V 人物小传(下)
- 区块链的叙事是如何崩塌的
- 人工智能的工程全景(下):Agent 全解
- 美国风险投资简史
- 一篇文章讲清楚美国的移民系统
- 细说美国的华人老钱家族
- 美国的犹太人和华人分别抢到了什么资源?详细分析
- AI圈大V名单(名单不断扩充中)
- 什么是控制论?控制论是AI的上辈子吗?
- 教宗良十四世论人工智能(精华版)
- 美国税收制度完全指南
- AI for Science 详细介绍(上):范式与版图
- 廉颇老矣,尚能饭否:现代数学史(下)
- 什么是世界模型?一个正在被争夺的概念
## 相关链接
- [snowboat](https://x.com/snowboat84)
- [@snowboat84](https://x.com/snowboat84)
- [218](https://x.com/snowboat84/status/2080159169806799316/analytics)
- [雅可比猜想:从 Vitushkin 的二维例子推出 Fable 的三维反例](https://x.com/snowboat84/status/2079683084979769478)
- [AI 商业模式的危机](https://x.com/snowboat84/status/2079355630452957309)
- [AI for Science 详细介绍(下):机会与入场](https://x.com/snowboat84/status/2078282144619593819)
- [流体力学研究史](https://x.com/snowboat84/status/2077983459369418941)
- [什么是推理模型?](https://x.com/snowboat84/status/2077613128746164625)
- [什么是希尔伯特的第六问题?这个问题重要吗?](https://x.com/snowboat84/status/2077249534049259588)
- [RAG:从前世今生到技术全景](https://x.com/snowboat84/status/2076868301809225932)
- [什么是信息论?它和AI是什么关系?](https://x.com/snowboat84/status/2075781603847188852)
- [AI可解释性综述](https://x.com/snowboat84/status/2075374060637503560)
- [AI for Science 详细介绍(中):资本与格局](https://x.com/snowboat84/status/2075095303389413496)
- [Skill是什么:写给零基础](https://x.com/snowboat84/status/2074652382299132237)
- [元宇宙衰亡史:炒作,破产,谁赚走了钱?](https://x.com/snowboat84/status/2074278858988380322)
- [AI 大V 人物小传(下)](https://x.com/snowboat84/status/2073554517065609544)
- [区块链的叙事是如何崩塌的](https://x.com/snowboat84/status/2073195935883288671)
- [人工智能的工程全景(下):Agent 全解](https://x.com/snowboat84/status/2072831459925307704)
- [美国风险投资简史](https://x.com/snowboat84/status/2072469163852124401)
- [一篇文章讲清楚美国的移民系统](https://x.com/snowboat84/status/2057980486501433383)
- [细说美国的华人老钱家族](https://x.com/snowboat84/status/2062326581776011623)
- [美国的犹太人和华人分别抢到了什么资源?详细分析](https://x.com/snowboat84/status/2063049247805837815)
- [AI圈大V名单(名单不断扩充中)](https://x.com/snowboat84/status/2069206740546343372)
- [什么是控制论?控制论是AI的上辈子吗?](https://x.com/snowboat84/status/2064496706042069340)
- [教宗良十四世论人工智能(精华版)](https://x.com/snowboat84/status/2059434342745866391)
- [美国税收制度完全指南](https://x.com/snowboat84/status/2060511915617779821)
- [AI for Science 详细介绍(上):范式与版图](https://x.com/snowboat84/status/2070656715515932930)
- [廉颇老矣,尚能饭否:现代数学史(下)](https://x.com/snowboat84/status/2059071134738620606)
- [什么是世界模型?一个正在被争夺的概念](https://x.com/snowboat84/status/2064135804092645410)
- [Upgrade to Premium](https://x.com/i/premium_sign_up)
- [1:12 PM · Jul 23, 2026](https://x.com/snowboat84/status/2080159169806799316)
- [218 Views](https://x.com/snowboat84/status/2080159169806799316/analytics)
---
*导出时间: 2026/7/23 14:44:32*