# 斯坦福 Stanford AI Index Report 2026
**作者**: Star@Day1Global Podcast
**日期**: 2026-04-30T07:46:45.000Z
**来源**: [https://x.com/starzq/status/2049757331093893278](https://x.com/starzq/status/2049757331093893278)
---

1. AI 能力并未触顶,反而在加速进步,触达的人群也比以往任何时候都更广。2025 年,业界产出了全球 90% 以上的"知名前沿模型"(notable frontier models)。其中数个模型在博士级科学问题、多模态推理、奥数竞赛上已达到或超越人类基线水平。在关键编码基准 SWE-bench Verified 上,模型表现一年内从 60% 跃升至接近人类基线的 100%。组织层面的 AI 采用率达到 88%,五分之四的大学生在使用生成式 AI。
2. 中美 AI 模型的性能差距已基本消失。自 2025 年初以来,中美模型多次互换领先位置。2025 年 2 月,DeepSeek-R1 一度追平美国顶级模型;截至 2026 年 3 月,Anthropic 的顶级模型仅领先 2.7%。美国仍在顶级模型数量和高影响力专利上占优;中国则在论文发表量、引用数、专利产出、工业机器人安装量上领先。韩国在创新密度上突出,人均 AI 专利全球第一。
3. 美国拥有全球最多的 AI 数据中心,但绝大多数芯片由一家台湾代工厂制造。美国拥有 5,427 座数据中心,是任何其他国家的 10 倍以上,能耗也是全球最高。台积电(TSMC)一家公司几乎制造了所有领先的 AI 芯片,使全球 AI 硬件供应链高度依赖台湾这一家代工厂——尽管 TSMC 在美国的扩产工厂已于 2025 年开始运营。
4. AI 模型能在国际数学奥林匹克(IMO)拿金牌,却无法可靠地辨识时间——这就是研究者所说的 AI 能力的"锯齿状前沿"(jagged frontier)。Gemini Deep Think 拿到了 IMO 金牌,但顶级模型读取模拟时钟的正确率只有 50.1%。AI Agent 在 OSWorld(测试代理在真实操作系统中完成电脑任务)的成功率从 12% 跃升至约 66%,但在结构化基准上仍约有三分之一的任务失败。
> 💡 jagged frontier(锯齿状前沿):指 AI 能力分布极不均匀——在某些任务上超越人类,在另一些看似简单的任务上却完全失败。这是 Ethan Mollick 等学者推广的概念。
5. 即使在受控环境中表现出色,机器人在大多数家务任务上仍然失败。机器人完成家务任务的成功率仅为 12%,凸显了 AI 在掌握物理世界方面与人类的差距。在软件仿真的 RLBench 上,机器人操作的成功率达到 89.4%——但可预测的实验室环境与不可预测的家庭环境之间存在巨大鸿沟。
6. 负责任 AI(Responsible AI)的发展未能跟上 AI 能力的提升,安全基准滞后,事故数量快速上升。几乎所有领先的前沿模型开发者都会报告能力基准的结果,但负责任 AI 基准的报告仍参差不齐。已记录的 AI 事故从 2024 年的 233 起升至 362 起。更糟的是,最新研究发现:改善某一项负责任 AI 维度(如安全性)会损害另一项(如准确性)。
7. 美国在 AI 投资上仍居全球领先,但其吸引全球人才的能力正在下降。2025 年美国私人 AI 投资达 2,859 亿美元,是中国 124 亿美元的 23 倍以上——不过仅看私人投资可能低估中国的总 AI 支出(中国有政府引导基金)。美国创业活动也最活跃,2025 年新获融资的 AI 公司达 1,953 家,是第二名国家的 10 倍以上。但是,迁往美国的 AI 研究者与开发者人数自 2017 年以来下降了 89%,仅过去一年就下降了 80%。
8. AI 采用以历史性速度扩散,消费者从这些常常免费使用的工具中获得了巨大价值。生成式 AI 在三年内达到 53% 的人口采用率,比 PC 或互联网的扩散速度更快——但各国差异显著,且与人均 GDP 强相关。新加坡(61%)和阿联酋(54%)的采用率高于预期;美国仅排第 24 位,为 28.3%。生成式 AI 工具到 2026 年初为美国消费者创造的估值已达每年 1,720 亿美元,每用户中位价值在 2025 至 2026 年间翻了三倍。
9. AI 带来生产力提升的领域,正是初级岗位就业开始下滑的领域。研究显示客服和软件开发的生产力提升达 14–26%,但需要更多判断力的任务效果较弱甚至为负。AI Agent 在几乎所有业务职能中的部署率仍是个位数。在 AI 生产力收益最明显的软件开发领域,22–25 岁的美国开发者就业人数自 2024 年下降近 20%,而高龄开发者的人数仍在增长。
10. AI 的环境足迹正与其能力同步扩张。Grok 4 的训练排放估计达 72,816 吨二氧化碳当量。AI 数据中心总功率容量上升至 29.6 吉瓦,相当于纽约州的峰值用电需求。GPT-4o 一年的推理用水量可能超过 120 万人的饮用水需求。
11. AI 模型在科学领域可超越人类科学家,但更大的模型并不一定表现更好。前沿模型在 ChemBench 上平均超越人类化学家,但在天体物理学复现题上得分低于 20%,地球观测题为 33%。一个 1.11 亿参数的蛋白质语言模型 MSAPairformer 在 ProteinGym 上击败了此前的领先方法;2 亿参数的基因组学模型 GPN-Star 击败了一个参数量近 200 倍的模型。绝大多数科学 AI 基础模型源自跨部门合作,与通用 AI 由产业界主导的格局形成鲜明对比。
12. AI 正在改变临床医疗,但严格的循证依据仍然有限。2025 年,自动从问诊中生成临床记录的 AI 工具被广泛采用。多家医院系统的医生反馈:写病历的时间最多减少 83%,倦怠感显著下降。但除少数工具外,临床 AI 的循证基础仍然薄弱。一项对 500 多项临床 AI 研究的综述发现,近一半依赖考试题式的问题而非真实病人数据,仅 5% 使用真实临床数据。
13. 正规教育落后于 AI 发展,但人们正在人生的每个阶段学习 AI 技能。超过 80% 的美国中学生和大学生在课业中使用 AI,但只有一半的中学有 AI 政策,且只有 6% 的老师认为这些政策清晰。课堂之外,AI 工程技能增速最快的是阿联酋、智利和南非。美国和加拿大的新晋 AI 博士数从 2022 到 2024 年增长 22%,但这些新增的博士选择了进入学术界而非产业界。
14. AI 主权(AI sovereignty)正成为国家政策的标志性议题,但各国能力仍不均衡,而开源开发正在重新分配参与权。各国国家级 AI 战略持续扩张,尤其在发展中经济体中。国家主导的 AI 超级计算投资同步上升——这是各国在国内 AI 生态系统主控权上野心扩张的信号。但模型生产仍集中在美中两国。开源开发正在重塑参与格局:除欧美外,世界其他地区在 GitHub 上的贡献已超越欧洲,正逼近美国,催生出语言更多元的模型与基准。
> 💡 AI sovereignty(AI 主权):指一个国家对其 AI 基础设施、模型、数据和人才的自主控制能力,相当于"算力时代的国家主权"。
15. AI 专家与公众对这项技术未来的看法存在巨大分歧,全球对 AI 监管机构的信任也支离破碎。关于 AI 对人们工作方式的影响:73% 的专家预期是正面的,而公众只有 23%——分歧高达 50 个百分点。在 AI 对经济和医疗的影响上,分歧同样显著。在受访国家中,美国本土民众对本国政府监管 AI 的信任度最低,仅 31%。从全球范围看,欧盟在有效监管 AI 上的可信度高于美国或中国。
全文:https://hai.stanford.edu/assets/files/ai_index_report_2026.pdf
## 相关链接
- [Star@Day1Global Podcast](https://x.com/starzq)
- [@starzq](https://x.com/starzq)
- [600](https://x.com/starzq/status/2049757331093893278/analytics)
- [https://hai.stanford.edu/assets/files/ai_index_report_2026.pdf](https://hai.stanford.edu/assets/files/ai_index_report_2026.pdf)
- [Upgrade to Premium](https://x.com/i/premium_sign_up)
- [3:46 PM · Apr 30, 2026](https://x.com/starzq/status/2049757331093893278)
- [600 Views](https://x.com/starzq/status/2049757331093893278/analytics)
---
*导出时间: 2026/4/30 16:39:02*