# 关于 Inkling 的数学思考
**作者**: deep Manifold
**日期**: 2026-07-21T23:15:22.000Z
**来源**: [https://x.com/BetaTomorrow/status/2079706832013316424](https://x.com/BetaTomorrow/status/2079706832013316424)
---

English Edition: Mathematical Considerations for Inkling
无属性激活使多模态学习成为可能,因为文本、图像和音频都可以被转换为数值,而不必在神经网络内部携带固定的模态身份。Thinking Machines 的 Inkling 因此提供了一个独特机会,使我们能够考察一个大型多模态输入模型如何在同一共享计算结构中耦合不同模态。本次深度流形解读将特别聚焦于模型的流形同调层面:早期模态耦合、位置结构、基于 Muon 的几何归一化,以及大规模强化学习,如何可能维持、变形或破坏已学习流形的关系连续性。
## 1. 模态的早期耦合
正如《关于全模态模型架构的数学思考》中所讨论的,核心问题并不只是文本、图像和音频最终是否进入同一个模型,而是它们在学习过程中何时以及如何发生耦合。Inkling 将三种模态转换为相互兼容的数值表示,并通过同一个 66 层 Transformer 进行处理。这建立了一种共享的关系机制,但相同的向量维度和共享注意力本身,并不足以证明模型形成了真正统一的多模态结构。

尚未得到回答的问题是:是否有大量经过完整对齐的文本—图像—音频数据,在足够早的阶段被引入训练,从而参与已学习流形的形成。如果训练主要依赖彼此分离的纯文本、图像—文本和音频—文本数据集,那么模型内部可能形成多个部分稳定的模态覆盖,而它们主要通过语言相互连接。在共享边界条件下进行早期且反复的耦合,才能更有力地证明跨模态关系真正参与了流形本身的构建。Thinking Machines 尚未披露足够的数据构成与训练阶段信息,因此这一问题仍无法确定。
## 2. RoPE 是 Transformer 的败笔
Inkling 决定放弃传统 RoPE,在数学上具有重要意义。RoPE 为查询和键的坐标施加一种预先定义的旋转结构,以表示相对位置。尽管这一机制在许多 Transformer 中取得了相当不错的效果,但它将一种外部设计的几何结构植入关系场中,而这个关系场的自然组织方式,理想情况下应当由数据学习得到。

从深度流形的角度看,RoPE 是 Transformer 的结构性缺陷之一。对于相对较短的文本序列,这种被强加的旋转几何或许尚可接受;但当面对长上下文、混合模态、高阶非线性关系以及不同分片覆盖之间的转换时,它就变得越来越值得质疑。Inkling 所采用的可学习相对位置方法并没有彻底解决位置问题,但它承认位置关系应当以更加灵活的方式从数据中学习,而不应由一种普遍适用的几何规定统一支配。
## 3. Muon 是几何归一化,而不是优化
Inkling 将 Muon 应用于大型矩阵参数,包括注意力投影矩阵,以及稠密层和路由专家层内部的矩阵。Muon 通常被描述为一种优化器,但它的核心作用是几何性的:它近似归一化矩阵更新中的奇异方向,使少数方向不会过度主导整体变化。

正如《神经网络优化的迷思》中所论述的,损失并不是学习本身那个未知的目标;它只是由数据、标签、奖励及其他边界条件构造出来的残差。因此,Muon 并没有发现某个最优解。它所做的是降低更新几何中的各向异性,并调节已学习流形在数值迭代过程中如何发生变形。更加均衡的变形可能有助于维持关系连续性,并减少突发性的结构损伤;但流形同调是否得到严格保持,仍然只是深度流形视角下的一种解释,而不是已经被证明的 Muon 性质。
## 4. 三千万次强化学习 Rollout 似乎过于庞大
Inkling 在后训练阶段使用了超过三千万次强化学习 rollout。对于一个总参数量达到 9750 亿的模型而言,这是一个极其庞大的完整生成与评估轨迹数量。Thinking Machines 报告称,奖励持续提升,推理轨迹也逐渐变得更加简洁;但如此巨大的规模同时提出了一个基本问题:为什么需要如此多次尝试,才能形成可控的推理投入?

正如《关于动态训练的数学思考》中所讨论的,与突然进行大规模变形相比,渐进式分阶段训练可能更有利于维持流形同调。我怀疑,Inkling 极其庞大的 rollout 数量正反映了这种反复分阶段过程:为了在不破坏此前已学习多模态结构的前提下巩固有用的推理路径,模型可能需要大量幅度较小、受边界条件控制的更新。若事实如此,那么这三千万次 rollout 不仅意味着过高的计算开销,也可能揭示了这样一个事实:要在维持同调连续性和训练效率的同时,重塑一个高度不规则的已学习场,是多么困难。
## 开放问题
1. 多模态数据是否从一开始就真正发生了耦合?
Inkling 是否使用了大量经过完整对齐的文本—图像—音频数据进行训练,还是主要依赖由纯文本、图像—文本、音频—文本和视频衍生样本构成的异构数据集合?Thinking Machines 尚未披露数据配对比例、时间对齐方法,也没有说明三种模态在同一训练边界条件下同时出现的频率。
这一差异具有根本意义。一个接受大量早期耦合训练的模型,可能允许跨模态关系从最初形成阶段就参与塑造流形。一个主要通过彼此分离的模态对进行训练的模型,则可能先学习出多个模态特定结构,之后再通过语言将它们连接起来。两类系统都可以接收三种模态,但它们并不具有相同的数学组织。

2. 训练究竟有多稳定?
Inkling 结合了极端的模型规模、数百个路由专家、多模态预训练、Muon–Adam 混合训练方法、长上下文架构,以及超过三千万次强化学习 rollout。然而,公开报告几乎没有提供关于损失突增、失败训练、专家失衡、路由坍塌、模态干扰、奖励不稳定或训练过程中突发结构转换的信息。
最终基准成绩无法揭示,要使这样一个庞大的已学习场保持稳定究竟有多困难。没有报告不稳定现象,并不等于训练过程是平稳的。一份严肃的技术报告应当展示不稳定阶段、纠正措施、路由行为、模态平衡以及训练动态的变化,而不应只展示最终检查点的性能。
- What is Deep Manifold ?
- Neural Network Fixed-Point Field
- Deep Manifold in the Real World
Single Token Geometry Series 单标几何系列
1. Single Token Geometry 01: Topology 单标的几何:拓扑
2. Single Token Geometry 02: DeepSeek V4 and Manifold Tearing 单标几何:DeepSeek V4 与流形撕裂
3. Single Token Geometry 03: Data Complexity 单标几何:数据复杂性
4. Single Token Geometry 04: A Critique of Manifold Steering 单标几何:对流形引导的批评
5. Single Token Geometry 05: Numerical Manifold Method 单标几何 :数值流形
6. Single Token Geometry 06: Stacked Piecewise Manifold 单标几何 06:堆叠分片流形
7. Single Token Geometry 07: Attention 单标几何 07:注意力
deepmanifold.ai
## 相关链接
- [deep Manifold](https://x.com/BetaTomorrow)
- [@BetaTomorrow](https://x.com/BetaTomorrow)
- [197](https://x.com/BetaTomorrow/status/2079706832013316424/analytics)
- [Mathematical Considerations for Inkling](https://x.com/BetaTomorrow/status/2079701135003394274)
- [关于全模态模型架构的数学思考](https://x.com/BetaTomorrow/status/2074900590904435093)
- [神经网络优化的迷思](https://x.com/BetaTomorrow/status/2079014802358448452)
- [关于动态训练的数学思考](https://x.com/BetaTomorrow/status/2076864642589299104)
- [What is Deep Manifold ?](https://x.com/BetaTomorrow/status/2070113382347461038)
- [Neural Network Fixed-Point Field](https://x.com/BetaTomorrow/status/2075335417189257256)
- [Deep Manifold in the Real World](https://x.com/BetaTomorrow/status/2072044191023329753)
- [Single Token Geometry 01: Topology 单标的几何:拓扑](https://x.com/BetaTomorrow/status/2045685439156437196)
- [Single Token Geometry 02: DeepSeek V4 and Manifold Tearing 单标几何:DeepSeek V4 与流形撕裂](https://x.com/BetaTomorrow/status/2047842924923416696)
- [Single Token Geometry 03: Data Complexity 单标几何:数据复杂性](https://x.com/BetaTomorrow/status/2050461737363951997)
- [Single Token Geometry 04: A Critique of Manifold Steering 单标几何:对流形引导的批评](https://x.com/BetaTomorrow/status/2052624515541410112?s=20)
- [Single Token Geometry 05: Numerical Manifold Method 单标几何 :数值流形](https://x.com/BetaTomorrow/status/2055396749729223026)
- [Single Token Geometry 06: Stacked Piecewise Manifold 单标几何 06:堆叠分片流形](https://x.com/BetaTomorrow/status/2060220654121890290)
- [Single Token Geometry 07: Attention 单标几何 07:注意力](https://x.com/BetaTomorrow/status/2062620023563378790)
- [deepmanifold.ai](https://deepmanifold.ai/)
- [Upgrade to Premium](https://x.com/i/premium_sign_up)
- [7:15 AM · Jul 22, 2026](https://x.com/BetaTomorrow/status/2079706832013316424)
- [197 Views](https://x.com/BetaTomorrow/status/2079706832013316424/analytics)
---
*导出时间: 2026/7/22 09:49:32*