# 别再迷信参数量:中国开源模型在硅谷踢馆成功
**作者**: Sentient China 华语
**日期**: 2026-04-25T09:02:55.000Z
**来源**: [https://x.com/sentient_zh/status/2047964559890333780](https://x.com/sentient_zh/status/2047964559890333780)
---

## ——100 亿参数的中国模型如何在企业级基准测试中击败 Claude Opus 4.5,以及这对行业的启示。
> 原文:Chinese AI with American Characteristics
> 作者:柳文浩(Leon Liu),Dolores Research 创始人 @0xHermes_
> 导读:本文作者柳文浩以单人身份参加 Sentient Arena Cohort 0,用中国模型 MiniMax M2.5 和自研智能体 Teller,在 Databricks OfficeQA 基准上以 71.5% 的准确率击败 Claude Opus 4.5。他提出,当模型层差距缩小到 2.7%,企业级 AI 的胜负手已从参数竞赛转向行为工程和驾驭层——而中国模型的胜利,恰恰发生在美国定义的评测标准、美国发明的工具语法和美国开源的运行时之上。
上周,我站在旧金山的讲台上,展示了一组在常理看来“不可能”的数据。我构建的智能体 Teller,在 Databricks 的 OfficeQA 基准测试中实现了 71.5% 的准确率。这项测试包含 246 个关于落地数值推理的问题,涉及 1939 年至 2025 年间长达 89,000 页的美国财政部公告。相比之下,Claude Opus 4.5 在该测试中的官方成绩为 67.8%,而运行在 Opus 4.5 上的 Sentient EvoSkill 框架的成绩则是 67.9%。
Teller 采用的模型是 MiniMax M2.5,这是一款来自中国的混合专家模型(MoE),总参数 2290 亿,激活参数仅为 100 亿。其整个评估过程的成本仅为 1.85 美元,折合每个问题 0.0075 美元。
这次活动是 Sentient Arena Cohort 0,一场由 Founders Fund、Pantera 和 Franklin Templeton 支持的 AI 智能体竞赛。所有团队都在相同的模型、相同的语料库和相同的评分标准下接受评估。唯一的变量是你如何指挥智能体。这并非一场模型性能的比拼,而是一场关于**“行为工程(Behavioral Engineering)”**的对照实验。结果不言而喻:即便受限于一款西方 AI 圈鲜有人提及的中国 10B MoE 模型,只要调度得当,也足以击败 Opus 4.5。
本文标题借用了邓小平著名的论断,但这种类比并非文字游戏。AI 领域正在形成一种真正的合力:中国的开源模型提供原始的执行力,而美国的编排方法论(提示工程、失效分析、框架架构)则将这种能力打造成可靠的性能。 单打独斗都无法达到这样的结果,合力则能超越巅峰。

## 那个无人谈论的模型
在硅谷,MiniMax 并不是一个家喻户晓的名字。这家总部位于北京的 AI 实验室构建了全球性能最强的开源模型家族之一,但英语 AI 社区几乎无人关注。
MiniMax M2.5 的能力特征非常罕见。它在 BFCL 多轮工具调用评估中以 76.8% 的胜率位列第一,这意味着它在结构化工具使用方面比 OpenAI、Anthropic 或 Google 的任何模型都要好。它通过超过 20 万个真实世界的工具环境进行了“智能体原生”的强化学习。它天生就知道如何使用 grep、解析文件、编写 Python 以及链式调用工具。你不需要教它。
但在 FinanceAgent 基准测试中,它的得分仅为 38%;在事实知识任务中,其幻觉率高达 88%;而且它的平均输出长度是其他模型的 3.7 倍,以惊人的速度消耗着上下文窗口。
这是 MoE 架构走向极致的代价。每次前向传播仅激活 100 亿参数(总 2290 亿),MiniMax 实现了极致的效率和工具调用精度,但其存储领域知识和抵抗幻觉的能力较弱。这是一个专家架构:执行力极强,知识储备薄弱。
如果你懂得如何与它协作,这种特性反而成了一种“功能”,而非“漏洞”。
## 似曾相识的节奏
我在北京长大,八岁移居美国。过去二十年里,我目睹了同样的周期在各个行业不断上演。
中国无人机曾被视为笑话、廉价玩具和拙劣的仿制品,直到大疆占据了全球消费级无人机 75% 的市场。中国电动车曾被轻视为“有理想的高尔夫球车”,直到比亚迪的销量在全球范围内超越特斯拉。同样的戏码也在机器人、生物制药和半导体设计领域上演。模式如出一辙:西方观察者低估,中国工程师迭代,当共识达成时,市场早已易主。
我正看到同样的事情在 AI 模型领域发生。
MiniMax 坐拥全球工具调用性能第一的宝座,硅谷却几乎无人基于它进行构建。DeepSeek 的 V3 证明了激活 37B 参数的 671B MoE 模型能以 1/20 的成本匹配 GPT-4 级别的性能。阿里巴巴的 Qwen 构建了全球最完整的开源模型生态系统。这些不是研究玩具,而是正部署在中国庞大的消费和企业市场中的生产力模型。因为它们是开源或开放权重的,所以任何愿意关注的人都可以使用。
但大多数西方开发者视而不见。他们不在其智能体架构中评估 MiniMax,不针对自己的场景测试 Qwen,也不阅读 DeepSeek 的技术报告。正因如此,他们正白白流失性能和成本优势。
## 宏观视角:中国开源 AI 被严重低估
Sentient Arena 的讽刺之处在于,比赛初衷是测试企业级 AI 的可靠性——这也是 Franklin Templeton 的 Julian Love 等支持者所关注的:AI 智能体能否在高风险的生产环境中进行可靠推理?答案是肯定的。但比赛中最可靠的智能体,跑在一个成本仅为西方同行零头的中国模型上。
这不是在鼓吹,而是一种模式识别。推动中国硬件创新的结构性优势(海量国内部署带来的迭代速度、价格敏感市场磨练出的成本管控、开源文化催生的快速社区改进)现在正在 AI 模型开发中发挥作用。MiniMax、DeepSeek 和 Qwen 产出的模型,反映了数千次真实世界的部署迭代;而那些主要针对基准测试和 API 营收进行优化的西方实验室,并没有在复制这种路径。
西方开发者的机会显而易见:这些模型现成、便宜,且在特定能力轴(尤其是工具调用和代码执行)上是世界顶尖的。风险则与 GoPro 和 3D Robotics 当初低估大疆时如出一辙:当你更新认知时,别人已经基于更好的底层架构完成了构建。
## 何谓“行为工程”?
“行为工程”听起来很抽象,直到你目睹它的失败。让我来具体化。
Sentient Arena 的限制很简单:所有人统一使用 MiniMax M2.5,统一使用财政部公告语料库。这创造了一个天然的实验场。唯一的区别在于提示词模板、技能文件、智能体框架配置和 MCP 服务器。没有微调,没有 RAG 流程,没有定制模型,只有指令。

我从每个工程师的起点开始:写更多的指令。我的技能文件从 138 行增长到 543 行,再到 631 行。我加入了公式教程、grep 示例、表格解析指南和检索策略。然而在达到 631 行时,准确率下降了。过载的指令反而降级了性能。
这就是注意力稀释问题,对于激活参数较少的 MoE 模型尤为严重。提示词中每一个不必要的 Token 都在争夺模型有限的注意力预算。指令越多,噪音越大。
于是我删掉了所有内容,精简到 37 行。一些之前从未通过的问题突然解开了,模型终于能听见真正关键的指令。但整体准确率又下降了——MiniMax 确实不知道什么是泰尔指数(Theil index),也不清楚 1976 年前美国财政年度的运作方式。你不能剥离模型本身缺失的知识。
答案既不在于堆量,也不在于极简,而在于**“密度”**。我重新从零开始编写:84 行代码,每一行都是一条规则、一个公式、一个陷阱或一个数据点。零教程,零示例代码,零解释性文字。教给模型它不知道的,不要教它已经会的。
这就是应用在 MoE 架构上的行为工程核心原则:识别模型执行力与知识储备之间的缺口,精准填补,不多一分。
## 三条铁律
通过对 25 个以上版本的消融实验,三条行为准则脱颖而出,其影响力超过了其他所有手段的总和。
在每个 Python 模块中写入 answer.txt。 这听起来很多余。计算还没完为什么要写部分答案?因为基准测试只对智能体结束时文件中的内容打分。空文件得零分,而一个粗略的中间答案可能落在 1% 的容错范围内。当我移除这条规则时,我丢掉了 22 个问题的得分。这不是提示词技巧,这是针对评分机制的保险策略。
所有计算均在 Python 中完成。 MiniMax 的幻觉率高达 88%。允许它用自然语言做算术意味着接受这种错误率。强制调用 scipy、numpy 和 statsmodels 可以消除整类精度失效。
写完最终答案后,立即停止。 不要重新验证,不要自我怀疑。模型想要二次检查工作的本能往往是有害的。它常在不必要的验证步骤中用错误答案覆盖正确答案。我称之为“自杀式核对”,这是我在加入该规则前最常见的行为失效模式。
这些规则并非领域特定的,它们适用于任何有精度要求的智能体场景。它们是行为层面的,而非知识层面的;它们约束模型“怎么做”,而非“知道什么”。
## Goose 的突破
整个比赛中最大的性能提升并非来自提示工程,而是来自更换了智能体运行时(Runtime)。
Goose 是 Block 公司开发的一个基于 Rust 的开源智能体框架,它有一个改变全局的架构特性:当上下文占用达到 80% 时自动压缩。 当上下文窗口填满时,Goose 会总结旧的工具输出,同时完整且忠实地保留最初的指令。
如果不使用这个特性,我记录到了系统性的准确率下降:早期问题的准确率为 80%(只需 3-5 次工具调用),后期则降至 60%(需 15-30 次工具调用)。随着工具输出的累积,模型对指令的注意力被稀释。对于仅有 10B 激活参数的 MiniMax 来说,这种效应极其敏感。
通过 Goose,整个过程的准确率稳定在 71-73%。成本从 14.50 美元骤降 87% 至 1.85 美元,因为提示词模板只需注入一次并随压缩保留,而无需随每次 API 调用重复发送。准确率上升,成本下降,且无需修改任何提示词。
这一发现可以推广到所有智能体工作流。对于涉及多步工具使用的场景,上下文窗口管理是性能的一等变量。智能体外壳不是简单的“水管”,而是架构本身。
## 人工版的 EvoSkill
Sentient 的 EvoSkill 框架能够从失败轨迹中自动发现智能体技能。在运行于 Claude Opus 4.5 时,EvoSkill 将 OfficeQA 准确率从 60.6% 提升至 67.9%。
我手动将同样的方法论应用在 12 场 Session 和 25+ 次提交中。在每次 Arena 提交后,我将所有失败分为四类:检索错误(找错文档)、提取错误(看错单元格)、计算错误(公式算错)和行为错误(空文件、自我怀疑)。
交叉对比显示,有 114 个问题无论如何配置都能通过,43 个总是失败,而有 89 个会随配置波动。那个“总是失败”的类别才是杠杆所在:我发现其中 5-7 个问题需要特定的金融公式,20 个需要更好的多文件提取策略。
我针对性地加入了公式定义(期望损失、HHI 指数、基尼系数等),直接将 CPI-U 年度均值嵌入提示词,并构建了针对跨年问题的回顾性策略。每次添加都是手术刀式的精准,而非散弹枪式的堆砌。
结果是:在 10B 模型上通过人工优化实现了 71.5%,而在参数量估计为其 20 倍的模型上通过自动化优化实现了 67.9%。目前来看,人类在失效分析中的判断力——知道哪些规则是保命的,哪些是噪音——依然胜过自动化优化。
## 合力:跨太平洋 AI 开发的真貌
这场比赛的真貌是:一个中国的“执行引擎”(MiniMax M2.5),由美国的“行为方法论”(失效分类、提示词密度优化、框架架构选择)编排,运行在美的“运行时”(Block 的 Goose)之上,在由跨国实验室(Sentient)组织、美国机构资本(Founders Fund 等)支持的竞赛中,接受美国基准测试(Databricks 的 OfficeQA)的检验。
这个栈里的任何单一组件都难当大任。没有行为工程的 MiniMax 仅得 58.5%(我第一次未优化的提交成绩)。没有强大执行模型的美国方法论只是空谈。没有正确提示词的 Goose 无物可保。
这对我来说不是抽象的观察。我是柳文浩。我在北京长大,在美国学会了如何构建。我所描述的这种合力并非读来的教条,而是我的思考方式。站在旧金山的讲台上,展示一个中国模型在企业级可靠性任务中超越西方顶尖系统的结果,我感到我背景的两半真正严丝合缝地扣在了一起。
企业级任务中 AI 智能体之间的表现差距,是行为层面的,而非能力层面的。这是 Dolores Research 的核心论点,而 Sentient Arena 正是验证这一论点的对照实验。一个 10B 参数的模型,只要调度得当,就能以 1/500 的成本超越前沿模型。
这对行业的启示是:AI 技术栈正在解构。模型能力、行为编排、运行时架构和领域知识正成为独立的变量。最终的赢家不会是拥有最大模型或最好提示词的团队,而是理解如何在这四个层面上进行综合重构的团队。
中国实验室正在产出世界级的执行引擎,美国实验室正在产出世界级的编排方法论。最有趣的工作正发生在它们的交汇处。
## 相关链接
- [Sentient China 华语](https://x.com/sentient_zh)
- [@sentient_zh](https://x.com/sentient_zh)
- [679](https://x.com/sentient_zh/status/2047964559890333780/analytics)
- [@0xHermes_](https://x.com/@0xHermes_)
- [Upgrade to Premium](https://x.com/i/premium_sign_up)
- [5:02 PM · Apr 25, 2026](https://x.com/sentient_zh/status/2047964559890333780)
- [679 Views](https://x.com/sentient_zh/status/2047964559890333780/analytics)
---
*导出时间: 2026/5/6 21:40:18*