何恺明和字节Seed跳到同一条河流:连续扩散语言模型的范式转移
文章深度解读了2026年5月何恺明MIT团队与字节Seed团队前后发布的两篇论文(ELF与Cola DLM)。两者殊途同归,挑战了主流的自回归(AR)生成范式,主张将语言模型的生成过程从“离散Token预测”转变为“连续空间的潜变量扩散”。这种“先思考后落字”的铅笔模式,不仅提升了效率与效果,更可能引发LLM底层架构、评估标准及多模态统一范式的新一轮变革。
文章深度解读了2026年5月何恺明MIT团队与字节Seed团队前后发布的两篇论文(ELF与Cola DLM)。两者殊途同归,挑战了主流的自回归(AR)生成范式,主张将语言模型的生成过程从“离散Token预测”转变为“连续空间的潜变量扩散”。这种“先思考后落字”的铅笔模式,不仅提升了效率与效果,更可能引发LLM底层架构、评估标准及多模态统一范式的新一轮变革。
本文探讨了张一鸣总结的拉开人与人差距的五种核心特质:保持好奇心与主动学习、对不确定性保持乐观、不甘于平庸、不傲娇并延迟满足感,以及对重要事情的判断力。文章指出,正是这些非学历、非背景的内在素质,在时间的复利下造成了巨大的发展差异。
北大教授、前字节跳动算法专家张驰分析中美AI现状。他指出国内大模型存在“应试刷榜”、基础算力设施薄弱、高质量数据飞轮断裂等问题。因国产模型体验差距,顶尖开发者纷纷流失至美国产品,导致数据反馈闭环恶化;过度依赖模型“蒸馏”也限制了原创能力。尽管在硬件和具身智能领域尚存优势,但在纯软件领域的整体差距恐将持续扩大。
本文对比了字节火山方舟与阿里百炼两大平台的 Coding Plan API 服务性能。通过 270 次请求测试,从响应速度、吞吐量(TTS)和稳定性三个维度,对包括 GLM、Kimi、DeepSeek 等主力模型进行了评估。结果显示,对于相同的旧版本模型,阿里百炼在速度上完胜;而字节方舟在模型更新速度(如 k2.6)和覆盖广度上更具优势。
本文深入探讨了 Looped LLM(循环大语言模型)的演进及其在 Claude Mythos 中的潜在应用。作者从字节跳动实习期间的研究出发,分析了循环架构在多跳推理任务上的优势,并指出 Anthropic 新发布的 Mythos 在 GraphWalk BFS 基准上的异常提升可能与底层状态跟踪能力有关。文章进一步探讨了将 Looped LLM 扩展至大规模应用时面临的“三道门槛”:深度稳定性(借鉴 RNN/SSM 理论解决梯度问题)、推理效率(结合 Diffusion Forcing 和 YOCO 优化并行度)以及单位 FLOPs 的有效性,强调了在算力预算有限时架构选择的重要性。
本文详细介绍了字节跳动旗下 AI 视频模型 Seedance 2.0 在 Higgsfield 平台上的使用方法。作者分享了如何利用该模型的全域参考系统,通过图像、视频和音频的组合输入,实现对视频风格、动作和人物的精准控制。文章涵盖了从创建逼真初始图像、生成高质量语音,到利用时间戳方法编写具体指令、绕过字符限制以及通过扩展功能保持视频连贯性的完整工作流程。
本文是对字节跳动扣子 2.5 的深度体验评测。文章详细介绍了新版本在日历任务管理、文件管理、CLI 命令行工具、云电脑与云手机(支持 App 自动化)、视频创作及全栈编程等方面的功能更新。作者认为扣子 2.5 通过将复杂的技术底层封装,实现了自然语言驱动的高效工作流,是目前国内体验最好、功能整合最完善的 AI 应用开发平台。
文章介绍了开源客户端 nexu(开源龙虾)作为全球首批接入字节跳动 Seedance 2.0 模型的工具,允许用户通过微信、飞书等聊天软件直接生成高质量 AI 视频。用户无需代码即可快速生成 2K 电影画质视频,文章提供了详细的安装配置教程及免费额度的领取方式,并展示了 nexu 作为全能 Agent 的其他强大功能。
字节跳动发布了豆包Seed 2.0系列模型,重点介绍了Seed 2.0 Code在编程场景的应用。该模型在Agent能力、视觉理解及前端开发上均有显著提升,且支持多模态。作者通过Trae IDE实测了该模型在开发桌面宠物、后端重构及视频生成任务中的表现,认为其速度快、全栈能力强。文章还提出了利用GLM-5做规划配合Seed 2.0 Code进行代码开发的高效工作流。