📚 Wiki 知识库

🏷️ AlphaGo

2 篇

强化学习沉浮史:从深度寒冬到大模型封神

文章回顾了强化学习七十年跌宕起伏的发展历程。从心理学的效果律与数学的动态规划这两条根源讲起,梳理了教科书时期的理论奠基与早期边缘化。随后,深度学习的引爆带来了黄金年代,DQN与AlphaGo的辉煌让强化学习备受推崇。然而,样本效率等缺陷曾让其一度跌入谷底。如今,这门学科在大模型时代通过RLHF等技术奇迹般重生,再次站到了AI舞台的中央。

技术LLM ✍ snowboat🕐 2026-07-23

高手都在用这个思维工具,收割普通人

文章借AlphaGo与Libratus AI的决策逻辑,阐述了“状态评估”优于“预测未来”的思维模型。通过对比两位创业者的经历,指出普通人常因追逐风口而忽略自身当前状态与目标之间的可达性(转移概率)。作者强调在商业和职业选择中,应依据当前确定的信号和一手经验做决策,而非依赖宏观数据或等待虚无缥缈的确定性。

职场职业发展 ✍ block0🕐 2026-05-18