强化学习沉浮史:从深度寒冬到大模型封神
文章回顾了强化学习七十年跌宕起伏的发展历程。从心理学的效果律与数学的动态规划这两条根源讲起,梳理了教科书时期的理论奠基与早期边缘化。随后,深度学习的引爆带来了黄金年代,DQN与AlphaGo的辉煌让强化学习备受推崇。然而,样本效率等缺陷曾让其一度跌入谷底。如今,这门学科在大模型时代通过RLHF等技术奇迹般重生,再次站到了AI舞台的中央。
文章回顾了强化学习七十年跌宕起伏的发展历程。从心理学的效果律与数学的动态规划这两条根源讲起,梳理了教科书时期的理论奠基与早期边缘化。随后,深度学习的引爆带来了黄金年代,DQN与AlphaGo的辉煌让强化学习备受推崇。然而,样本效率等缺陷曾让其一度跌入谷底。如今,这门学科在大模型时代通过RLHF等技术奇迹般重生,再次站到了AI舞台的中央。
文章借AlphaGo与Libratus AI的决策逻辑,阐述了“状态评估”优于“预测未来”的思维模型。通过对比两位创业者的经历,指出普通人常因追逐风口而忽略自身当前状态与目标之间的可达性(转移概率)。作者强调在商业和职业选择中,应依据当前确定的信号和一手经验做决策,而非依赖宏观数据或等待虚无缥缈的确定性。