当物理遇上AI:深度学习里的物理元素(下)
本文是《当物理遇上AI》的下篇,探讨了深度学习中的未解难题与物理学现象的同构关系。作者详细分析了Scaling Law与临界标度律、模型涌现与相变、双下降曲线与随机矩阵理论之间的深层联系。文章评估了这些类比证据的强弱,指出部分物理数学工具已能精确推导AI行为,同时也讨论了争议与未解之谜。
本文是《当物理遇上AI》的下篇,探讨了深度学习中的未解难题与物理学现象的同构关系。作者详细分析了Scaling Law与临界标度律、模型涌现与相变、双下降曲线与随机矩阵理论之间的深层联系。文章评估了这些类比证据的强弱,指出部分物理数学工具已能精确推导AI行为,同时也讨论了争议与未解之谜。
本文深入探讨了 Looped LLM(循环大语言模型)的演进及其在 Claude Mythos 中的潜在应用。作者从字节跳动实习期间的研究出发,分析了循环架构在多跳推理任务上的优势,并指出 Anthropic 新发布的 Mythos 在 GraphWalk BFS 基准上的异常提升可能与底层状态跟踪能力有关。文章进一步探讨了将 Looped LLM 扩展至大规模应用时面临的“三道门槛”:深度稳定性(借鉴 RNN/SSM 理论解决梯度问题)、推理效率(结合 Diffusion Forcing 和 YOCO 优化并行度)以及单位 FLOPs 的有效性,强调了在算力预算有限时架构选择的重要性。
文章基于作者在 ByteDance Seed 的研究经历,探讨了 Looped LLM 架构的起源与演进。作者通过分析 Anthropic 发布的 Claude Mythos 在 GraphWalk BFS 基准上的异常表现,指出 Looped 架构在多跳推理和状态追踪上的优势。文章进一步深入讨论了 Looped LLM 在扩展至 10T/100T 规模时面临的深度稳定性、推理效率和 FLOPs 有效性的三大挑战,并对比了 RNN 视角与 Parallel Looped Transformer 等解决方案。