谢赛宁对LLM的判断:从Sora关停到世界模型的崛起 ✍ Bill_DO_A_BIT多少做点🕐 2026-04-29📦 15.8 KB 🟢 已读 𝕏 文章列表 文章从OpenAI关停Sora切入,深入探讨了Sora核心架构DiT创造者谢赛宁对大语言模型(LLM)的根本性质疑。谢赛宁认为LLM只是在模仿语言的统计规律,而非理解世界,语言是“鸦片”。文章详细阐述了基于抽象表征空间的预测架构(JEPA)和世界模型才是通往通用智能的正确路径,并指出未来的AI架构中,LLM将退化为仅用于交流的界面,而表征层才是真正的基石。 LLMSora谢赛宁世界模型JEPA人工智能深度学习DiTOpenAI技术洞察 # 从Sora关停开始:谢赛宁对LLM的判断正在逐步验证 **作者**: Bill_DO_A_BIT多少做点 **日期**: 2026-04-29T11:55:11.000Z **来源**: [https://x.com/Bill_Do_A_Bit/status/2049457466489061757](https://x.com/Bill_Do_A_Bit/status/2049457466489061757) ---  OpenAI 关停了 Sora。每天 1500 万美元推理成本,上线不到一年就被砍掉。Sora 团队下一步要做什么?转向"世界模型"和机器人。 但真正有意思的不是成本。是 Sora 核心架构 DiT 的创造者,从来不认为 Sora 是世界模型。 这个创造者叫谢赛宁。他带的实习生 Bill Peebles 把 DiT 带到 OpenAI,催生了 Sora。在上一篇文章里,我提了一句:一只松鼠的智能可能比语言大模型还高。那篇文章写的是他这个人、他怎么看世界。而这一篇,我想展开他的那个核心判断:他到底为什么这么说?论证链条是什么? 他花了七个小时的后半段,讲了一件所有 AI 从业者都不太敢直视的事:现在全世界押注的语言大模型,可能从根基上就是错的。不是做得不好,是方向不对。他不是光嘴上说,他有一个叫 JEPA 的替代方案,正在拿十亿美元去验证。 ## 语言大模型到底在做什么? 要理解他的判断,先得理解 LLM(大语言模型) 到底在做什么。 简单说,LLM 做的事情是预测下一个词。你给它一句话的前半段,它猜后半段。它的训练数据是人类几千年写下来的文字——书籍、论文、网页、对话。Next token prediction,本质上是在模仿语言的统计规律。 谢赛宁的说法是:LLM 不是自监督学习,是强监督学习。 这句话需要解释一下。行业里的主流叙事是——LLM 实现了"自监督学习"的突破,不需要人工标注,让机器自己从数据中学。但谢赛宁指出:语言免费不代表没有 label。几千年文明积累的文字、语法、逻辑结构、知识体系——这些不是"无标注数据",这是人类花了几千年帮 AI 标注好的训练集。语言本身就是一个极其精细的 supervision construction(监督信号构建过程)。 换一种说法:LLM 只是在刻画 y space(标签空间)。语言是人类用来交流的工具,不是用来思考和决策的工具。你用语言训练出来的 AI,学到的是"怎么说话像个人",而不是"怎么理解这个世界"。 然后他聊到了一个叫 Moravec 悖论的东西,让我对"智能"的理解彻底翻转了。 这个悖论说的是:人类进化了几百万年才掌握的能力——走路、抓东西、判断一根树枝能不能承受自己的重量——AI 做不好。但人类只花了几千年发明的东西——数学、编程、考试、写论文——AI 轻松碾压。 这说明什么?我们以为最难的东西(逻辑推理、做数学题),在进化的尺度上其实是最简单的。我们以为最简单的东西(在物理世界中生存、感知环境、做出反应),其实才是最难的。 谢赛宁算了一笔账。如果把生物智能的整个进化历程——大约 5.3 亿年——压缩成一天,语言的出现大概只占最后 8 秒钟。松鼠解决的是 530 million years 进化都在解决的问题。LLM 解决的是最后 8 秒钟人类发明的问题。 所以他说一只松鼠的智能可能比 LLM 还高——这不是故意夸张,这是从进化时间尺度出发的逻辑推演。 ## 语言是鸦片——而且 Sora 也不是答案 他用了一个极端的比喻来描述语言对 AI 研发的影响:语言是鸦片。 加多了你总觉得更好。但如果一直吸鸦片你就废了。如果它是拐杖——拄着拐你永远练不出大腿肌肉。 翻译成人话:语言给了 AI 一条捷径。杯子摔在地上会碎——LLM 能说出这句话,但它不 care 这个过程中发生了什么物理变化。它知道语言层面的因果关系("摔了→碎了"),但不理解物理层面的 dynamics(杯子和地面之间发生了什么)。 但有人就会问了:那 Sora 呢?它能生成逼真的视频,画面细腻到以假乱真,这是不是就算理解世界了? 他画了一个阶梯来说明这件事: ▶ P(y) — 语义/标签空间 — GPT / Claude — ❌ 只在模仿语言 ▶ P(x|y) — 像素空间 — Sora / 视频生成 — ❌ 像素 = 给人看的接口 ▶ Latent — 抽象表征空间 — World Model — ✅ 真正理解世界 关键在中间那一行。像素本身也不够 Bitter Lesson。 谢赛宁说:像素是人为定义的 regular grid——256 级灰度、RGB 三通道——它也是一种接口,是给人看的。World Model 是给系统看的,不需要给人看。 类比一下:Sora 就像一个画技精湛的画家——它能画出一个球滚下楼梯的场景,画面无比逼真。但它不"知道"球为什么会滚、滚到哪里会停、如果楼梯中间有个障碍物会怎样。它预测的是下一帧像素长什么样,不是下一个物理状态是什么。生成视频 ≠ 理解世界。 所以 Sora 关停了,不让人意外。它的推理成本那么高,恰恰是因为它在像素空间做预测——需要重建每一个细节。而真正的世界模型不需要重建一切,只需要在抽象层面理解"接下来会发生什么"。 ## 那地基到底是什么?——World Model 与 JEPA 如果不是语言,也不是像素,那智能的地基到底是什么? 谢赛宁给出了一个数学定义: > S(t+1) = F(S_t, a_t) 给定当前状态加上你的动作,预测下一个状态。这就是 世界模型(World Model) 的严格定义。 这不是什么科幻概念。1943 年 Kenneth Craik 就提出了类似的想法。控制论里的 MPC(Model Predictive Control) 在用同样的框架。强化学习里 Richard Sutton 的 Dyna 架构也是这个思路——先在脑子里建一个世界的模型,用它做 rollout(模拟推演),挑出最优的行动路径——这就是 planning。而 Planning ≈ Reasoning。 > "这个世界上只有一件事情是重要的——怎么学到表征(representation)。当你有一个足够好的表征,在上面处理其他问题都是简单的。" 这条路线的技术实现,就是 JEPA——Joint Embedding Predictive Architecture(联合嵌入预测架构)。杨立坤提出,谢赛宁和他正在一起推。 JEPA 的核心思想可以用一句话说清楚:不要在像素空间做预测,在抽象表征空间做预测。 - LLM:输入语言 → 预测下一个词(在语言空间) - Sora:输入视频帧 → 预测下一帧像素(在像素空间) - JEPA:输入世界的状态 → 预测下一个状态的抽象表征(在 latent space) 谢赛宁反复强调:JEPA 不是一个算法,它是一整套认知体系——需要 world understanding(理解世界)、prediction(预测能力)、planning(规划能力)。LLM 是其中的一部分,不是全部。 为什么 JEPA 更有意义?因为它不需要重建每一个像素细节。你在马路上走路,不需要知道每片树叶的位置——你只需要知道前方有棵树、左边有辆车在靠近、地面是湿滑的。人的大脑也是这么工作的:10 亿 bits/s 的传感器信号输入,压缩到 10 bits/s 的行为决策输出——中间那个 10 的 7 次方倍的信息过滤系统,就是世界模型在做的事。 ## Bitter Lesson——全文最反直觉的部分 先解释一个概念。2019 年,AI 领域的泰斗 Rich Sutton 写了一篇短文,叫 "The Bitter Lesson"(苦涩的教训)。核心观点是:AI 的历史反复证明,利用算力做通用搜索和学习的方法,最终总会打败依赖人类先验知识的精巧设计。简单说就是——别搞精巧的人工设计,让机器自己从数据中学。 行业的共识是:LLM 的成功就是 Bitter Lesson 的胜利。GPT 不设计语法规则、不灌入人类知识,只是给足算力和数据做 next token prediction——智能就自己涌现了。 然后他说了一句,让我卡住了: > "Bitter Lesson 说应该减少 human knowledge。但语言就是人类极其聪明的产物——它不是多和少的问题,它全都是。" 1. Bitter Lesson 的核心主张:减少人类先验知识的注入 → 让机器自己从数据中学 2. LLM 实际在做的事:用人类花了几千年积累的语言来训练 → 语言本身就是最大的人类先验知识 → 这恰恰是在注入先验,不是减少 3. 真正符合 Bitter Lesson 的做法:在 latent space 做预测 → 不依赖语言的句法结构,也不依赖像素的规则网格 → 最大限度地减少人类先验 → JEPA / World Model 才是正 Bitter Lesson 的 所以结论是:LLM 看起来像 Bitter Lesson 的胜利,实际上是反 Bitter Lesson 的。 这个判断如果成立,意味着整个行业最底层的叙事逻辑——"LLM 证明了 Bitter Lesson,所以只要继续 scale up 就行"——可能从根基上就站不住。 ## 谁来给机器人装大脑? 谢赛宁透露了一个让我惊讶的内情:目前没有任何 robotics startup 在做机器人的"大脑"——也就是预训练。 他私下联系过大厂的机器人研究员。大家都在做运动控制——让机器人走路、翻跟头、在春晚舞台上跳舞。但没有人在做让机器人"理解它看到的世界"这件事。机器人能做出漂亮的动作,但它不知道自己为什么要做这个动作、眼前的环境意味着什么、接下来可能会发生什么。 这就是 JEPA 和 World Model 的主攻方向——给机器人装上大脑。 他用了一个叫 Cambrian 的框架来描述当前 AI 智能的阶梯——我们在哪里,终点在哪里: ▶ L0 纯语言模型 — 柏拉图洞穴,通过语言影子了解世界 — GPT / Claude ▶ L1 当前多模态 — Show and Tell,看图回答 — GPT-4V ▶ L2 Streaming Cognition — 处理连续视觉流,实时理解 — 早期研究 ▶ L3 Spatial Cognition — 超越像素看到 3D 空间 — 早期研究 ▶ L4 Predictive World Model — 预测行为后果,指导决策 — JEPA / AMI Labs 现在大部分产品还停在 L0 到 L1。L4 是终点——让 AI 能在脑子里模拟接下来会发生什么,然后做出决策。这正是谢赛宁和杨立坤在做的事。 而且 JEPA 的应用远不止机器人。他说:"JEPA 是一个非常广阔的海洋,在这个海洋里面可以有好多好多的船。" - 机器人 action:不只是动作控制,而是让机器人理解世界后再做决策 - AI 眼镜:always-on 的认知能力,持续理解你看到的世界 - 垂直行业:飞机引擎(1000 个传感器的预测性维护)、医院和养老院、农场、工厂 这些场景有一个共同点:都需要从真实世界中学习,而不是从互联网文本中学习。 这也决定了 AMI Labs 的商业模式和 OpenAI 完全不同。他叫它"反向 OpenAI",用了一个 Mastercard 的类比: 正向 OpenAI:download internet → 训练 GPT → 推向市场。数据是现成的——互联网就是免费的训练集。 反向 OpenAI:世界需要模型,模型也需要世界 → 与行业伙伴组成草根联盟 → 共建世界模型。数据不是现成的——必须从工厂传感器、医院监控、农场环境中获取。 就像当年 Bank of America 建了 Visa 赚得盆满钵满,其他小银行联合推出 Mastercard 分庭抗礼。AMI Labs 要做的是 World Model 领域的 Mastercard——一个去中心化的联盟。 ## 认知翻转 回过头看,谢赛宁不是在追赛道。他用十年的研究主线指向同一件事: 现在所有人追的方向,可能建在了错误的地基上。 他不是第一天这么想的。从早期的 DSN 到 MoCo、MAE,到 DiT、Cambrian、REPA——他做了十年表征学习,每一步都指向同一个终点:好的表征 = 世界模型的核心。 LLM 不是错了,是不够——它只覆盖了智能拼图中"最后 8 秒钟"的那一小片。 而 JEPA 不是一个具体的模型——它是一整套认知体系。理解世界、预测未来、规划行动。语言模型只是其中的一个解码接口,不是地基。 而且他不是说说而已——他用三次拒绝证明了自己的判断。 2018 年,Ilya Sutskever 给他发了 OpenAI 的 offer。他拒了。Ilya 亲自打电话,非常生气,问"是不是钱给得不够"。那一年的 FAIR 对 PhD 来说比 OpenAI 更有确定性——但更关键的是,他选了视觉研究,不是语言。 2024 年 7 月,Ilya 创办了 SSI(Safe Superintelligence),又来找他,问愿不愿一起做。他第二次拒绝——因为 SSI 走的还是纯语言路线。那次谈话他们主要聊的是哲学:怎么给 AI 赋予爱的能力。但路线分歧太大——Ilya 认为多模态和视觉"已经解决得很不错了",谢赛宁认为这恰恰是最重要的未解之题。 他甚至是最早看到 Perplexity demo 的人之一——Aravind(Perplexity CEO)在 Palo Alto 的 Blue Bottle 咖啡店给他演示,说要"革了 Google 的命"。他心里想的是:"这不就是 GPT 套了个壳?"拒绝了邀请,选择留在 NYU 做 research。 三次拒绝 LLM 阵营,每一次都选了 Vision 和 World Model。每一个决定,用他自己的话说,"都比较忠诚于自己的内心"。 这是一条完整的技术路线,不是一个口号。他和杨立坤正在用十亿美元去验证它。而现在,连 Sora 的团队都开始转向世界模型了。 ## LLM 终将凋零 他对语言大模型的终局判断,用了一句老兵的话: > "LLM 永不会死,但终将凋零。Old soldiers never die, they just fade away." > "它不是构建 universal 智能系统的基石。不是世界模型大厦的地基。" 他的 bet 是:未来的 AI 架构里,LLM 会退化为一个 communication interface(交流界面)——你用它和 AI 对话,但 AI 真正"思考"的过程不在语言层,在表征层。表征层才是 foundation。从表征层可以 decode 出任何东西——语言、像素(生成视频)、action(控制机器人)。 AMI Labs:融资十亿美元,估值三十亿美元,6 位联合创始人,25 人初始团队。有人放弃了 OpenAI 数千万美元的未兑现股票、Meta 1500 到 2000 万美元的 offer 加入。他们不是含着金汤匙的——他们自称 underdog,草根联盟。 用姚顺雨的话说:这是预训练的下半场。 LLM 的预训练是上半场;World Model 的预训练才是下半场。 这不只是一个技术判断。更让我感兴趣的,是他怎么做出这个判断的方式。 - Vision as Perspective——视觉不是一个具体的研究领域,它是理解智能的本质视角。CV 越来越少人做不代表它不重要。所有做 LLM 的人,最终都要回来解决 vision 要解决的问题。 - 无限游戏——当所有人追 LLM 的时候,他选了一条几乎没人走的路。他说研究者的成就取决于最好的那一次(max),不是平均值(average)。你只需要成功一次。 - 反脆弱——DiT 被 FAIR 丢弃后成了 Sora 的核心。论文被拒、方向冷门、同行不理解——在反脆弱系统里,这些都不是损失,随机事件带来的收益大于损失。 这个世界最大的风险,不是 AI 发展得太快。而是所有人都在同一条路上跑——没有人停下来问:这条路的地基对不对? 他停下来了。然后他选了另一条路。 ## 相关链接 - [Jackywine reposted](https://x.com/Jackywine) - [Bill_DO_A_BIT多少做点](https://x.com/Bill_Do_A_Bit) - [@Bill_Do_A_Bit](https://x.com/Bill_Do_A_Bit) - [462](https://x.com/Bill_Do_A_Bit/status/2049457466489061757/analytics) - [Upgrade to Premium](https://x.com/i/premium_sign_up) - [7:55 PM · Apr 29, 2026](https://x.com/Bill_Do_A_Bit/status/2049457466489061757) - [462 Views](https://x.com/Bill_Do_A_Bit/status/2049457466489061757/analytics) --- *导出时间: 2026/4/29 21:45:34*
H How to Build LLM Architectures From Scratch 本文是一篇关于从零构建大型语言模型(LLM)架构的深度指南。文章详细解释了 LLM 的工作原理,包括从原始数据收集、清洗、分词,到 Transformer 架构的核心组件(如自注意力机制、位置编码)。同时涵盖了预训练、微调、基于人类反馈的强化学习(RLHF)以及推理优化等关键技术环节,旨在帮助读者理解 ChatGPT 和 Claude 等模型背后的系统构建全流程。 技术 › LLM ✍ Shabnam Parveen🕐 2026-05-25 LLMTransformer架构设计RLHF深度学习人工智能模型训练OpenAIChatGPT技术原理
什 什么是世界模型?(WTF is a World Model?) 本文深入探讨了人工智能领域热门概念“世界模型”。文章指出世界模型是一个问题陈述而非特定架构,类似于SLAM。文章通过自动驾驶案例阐述了Yann LeCun的形式化定义(状态预测与渲染分离),并对比了当前三种主流范式:生成式模型(如Sora)、潜在动力学模型(如Dreamer)以及JEPA架构,分析了它们在压缩策略和预测目标上的差异。 技术 › LLM ✍ Vai Viswanathan🕐 2026-05-02 世界模型Yann LeCun机器人技术SoraDreamerJEPA深度学习强化学习
什 什么是世界模型?概念溯源、流派划分与AI新前沿 本文深入探讨了当前AI领域的热门概念“世界模型”。文章梳理了该概念从1943年心理学起源到2024年爆发式发展的历史脉络,详细区分了两大核心阵营:用于行动的模型(如DreamerV3和JEPA)与用于呈现的模型(如Sora和视频生成)。文中分析了杨立昆、李飞飞及OpenAI等不同派别的技术路径与定义之争,揭示了世界模型如何成为超越大语言模型的下一代AI竞争焦点。 技术 › LLM ✍ snowboat🕐 2026-06-09 世界模型AI杨立昆Sora强化学习Agent深度学习技术趋势概念科普
Z Zero to AI Engineer — The Roadmap Nobody Explains Properly 本文提供了一个为期14周的实战型AI工程师学习路线图,旨在解决初学者“只学不做”的困境。文章从环境搭建开始,详细列出了从AI基础、机器学习、深度学习到现代LLM工程及Agent开发的最佳免费资源(如OpenAI/Anthropic官方课程、Karpathy的教程等)。路线强调通过GitHub项目实践来理解原理,最终掌握部署与评估技能,真正从零开始构建可用的AI系统。 技术 › LLM ✍ Shruti Codes🕐 2026-05-17 AI工程师学习路线LLMAgent深度学习RAG实战教程机器学习OpenAIAnthropic
大 大厂正在秘密开发的下一代架构:状态空间模型 SSM 本文探讨了科技巨头如 NVIDIA、Meta 和 Microsoft 正在秘密研发的状态空间模型(SSM),旨在解决 Transformer 架构在长序列处理中的计算和内存瓶颈。文章详细介绍了 SSM 的线性复杂度优势,并列举了 NVIDIA Nemotron-H 和 IBM Bamba-9B 等混合模型如何通过替换 Attention 层来提升推理速度和降低内存消耗。此外,文中还回顾了 S4 和 Mamba 等 SSM 架构的演变,展示了 SSM 在大模型未来的巨大潜力。 技术 › LLM ✍ Siddharth🕐 2026-05-06 SSMMambaTransformerLLM架构Nvidia推理优化人工智能深度学习
一 一文搞懂 Agent Harness:如何给 AI 大脑装上身体 本文基于对 ShareAI 创始人新璐的访谈,深入解读了 Agent Harness 的核心概念与架构设计。文章指出,Harness 是模型之外赋予 AI 行动能力、记忆与协作能力的“身体”。通过剖析 Claude Code 的三层结构——执行层、记忆层与治理层,作者阐述了从“流程驱动”向“模型自主决策”转变的工程实践。文章强调,优秀的 Harness 应提供类 UNIX 的稳定环境与结构化的记忆机制,从而释放模型的潜能,使其成为真正的智能合作伙伴。 技术 › Agent ✍ Saito🕐 2026-05-06 AgentHarnessClaude Code架构设计工程实践LLM人工智能ShareAI播客笔记技术洞察
R RLMs are the new reasoning models 本文探讨了递归语言模型作为一种新的推理范式的重要性。RLM 通过将模型自己的提示视为可检查、切片和递归查询的环境,直接结合了推理和工具使用。文章回顾了推理和工具使用的历史发展,从思维链到 ReAct,再到 OpenAI o1 和 Claude 的工具使用。最新研究显示,RLM 在长上下文、记忆和长推理任务中表现出色,克服了传统单次前向传播的局限。 技术 › LLM ✍ Raymond Weitekamp🕐 2026-04-21 RLM推理模型递归语言模型工具使用长上下文LLM人工智能机器学习深度学习算法
一 一文彻底打通AI底层逻辑:从LLM到Agent核心概念拆解 本文是一篇基于工程视角的AI技术硬核解析,旨在厘清从LLM大模型到Agent智能体的核心概念体系。文章深入浅出地拆解了LLM的文字接龙本质、Tokenizer的翻译机制、上下文窗口的容量限制,以及Prompt工程、MCP工具协议和Agent技能的运作原理,帮助读者建立完整的底层技术认知。 技术 › LLM ✍ Vincent|只上干货🕐 2026-04-07 LLMAgent人工智能技术解析底层逻辑Prompt工程MCP大模型AI技术深度学习
2 2025 大语言模型年度回顾 本文是对 2025 年大语言模型(LLM)领域发展的深度回顾。主要趋势包括:推理模型的普及(OpenAI o 系列)、Agent 和编码 Agent 的爆发式落地(特别是 Claude Code)、中国开源模型在排行榜上占据主导地位、长任务处理能力的翻倍增长、Google Gemini 的全面崛起以及 OpenAI 领先优势的缩小。此外,文章还涵盖了图像编辑、学术竞赛表现、模型安全与“告密”现象等热点话题,指出 2025 年是 AI 实用化和工具化的一年。 技术 › LLM ✍ Tw93🕐 2026-01-17 LLMAgentOpenAIClaudeGemini深度学习年度回顾中国开源代码生成AI安全
C ChatGPT Agent Loop 优化技术解析 本文深入解析了 ChatGPT 如何通过 Harness、API 和 Inference 三层架构优化 Agent 循环,重点介绍了持久化 WebSocket、增量 Token 化、KV 缓存管理和推测解码等技术,以降低成本并提升效率。 技术 › Harness Engineering ✍ Bytebytego🕐 2026-07-30 Agent优化LLM架构ChatGPTOpenAI性能成本控制WebSocketTokenization
B BestBlogs 早报|实现周期骤缩后,创业者如何重选问题 本期早报探讨了 AI 智能体缩短实现周期后,创业者的机遇与挑战。文章涵盖 Sam Altman 对创业窗口的判断、GPT-5.6 的效率工程实践,以及如何通过 Skill Harness 将模型能力封装为可维护的产品功能。 技术 › Skill ✍ ginobefun🕐 2026-07-30 GPT-5.6Agent创业效率工程ProductHarnessSkillLLMOpenAI
M Math Behind Large Language Model 本文介绍了大语言模型背后的数学原理,涵盖Attention机制、缩放因子、反向传播、梯度下降、交叉熵损失、RoPE位置编码和RMSNorm归一化等核心概念。 技术 › LLM ✍ Amit Shekhar🕐 2026-07-30 LLM数学原理AttentionTransformer机器学习深度学习梯度下降反向传播RoPERMSNorm