# 实测美团 LongCat-2.0,国产芯片长出来的万亿大模型
**作者**: 卡尔的AI沃茨
**日期**: 2026-07-01T14:43:53.000Z
**来源**: [https://x.com/aiwarts/status/2072330356557230514](https://x.com/aiwarts/status/2072330356557230514)
---

是的,我的 Claude 又被封了,
急急国王的我又开始盯上国产模型的 API 了,刚好美团发布了 LongCat-2.0。
就这样说吧,一个总参数 1.6 万亿,每个 token 只激活约 480 亿参数的 MoE 模型,
从预训练到大规模部署,全程跑在 5 万张国产算力芯片上,跑了一个多月,吃掉超过 35 万亿 tokens,全程无回滚,没有一次不可恢复的 loss 突刺。
这真的发生了。。。

可能有些朋友对这件事没太大感觉,我帮你把时间往回拉两年。
那会儿英伟达的 A100,H100 这些高端卡被卡脖子。
整个行业最焦虑的问题,都不是国产卡好不好用,
是个更要命的问题,没有英伟达,我们还能不能接着做大模型。
所以 LongCat-2.0 这次做出来的意义从来不是它是不是今天最强的模型。
是它把一条特别难的链路,完整跑通了一遍。(人类撰写声明)
从训练到大规模部署,官方口径都是国产算力,同时也已经接到了 API 和开发者工具里。
这个分量,比多刷几个 benchmark 第一要重。
时间点还赶得巧。
Claude 各种封号限流,8 号马上还有来一波大的,
现在都有点心灰意冷,想做 API 战士了。但是纯 API 的话,Claude 就不能作为主力模型了,它肯定是一个辅助的专注于 UI 和出计划的模型。这样就需要第三个模型融入到我的工作流里面,
一个独立在 CodeX 和 Claude 之外,永远不会被卡壳的模型。
就在这个节骨眼上,冒出来一个能开源、还能直接接进现有工作流的国产万亿模型,就很爽了。
当然,LongCat-2.0 不是全面 SOTA。
倒不是说它一发布,明天大家就能彻底告别 Claude。
像是IFEval,GPQA-diamond 这种更偏通用能力和知识推理的项目,它跟 Gemini 3.1 Pro,GPT-5.5 还点有差距。轮到Agent 场景版本强度就上来了,在Terminal-Bench 2.1和 SWE-bench Pro 这类编程任务上,它基本追平 Gemini 3.1 Pro。在FORTE 这种通用 Agent 任务上,也跟 Claude Opus 4.6 五五开了。
LongCat-2.0 还拥有最大输出的 128K。以及最高提供到了 1M 上下文。

它这次花心思的地方,是怎么让模型在又长又乱的任务里还稳定出结果。
是一个叫 LSA 的稀疏注意力机制,面对超长输入时,模型不再一个字一个字从头硬啃。毕竟 Agent 干活要读代码库,翻文档,还要记住前面十几步操作,还要继续调工具等等。LSA 解决的就是这个问题。

另一个叫 N-gram Embedding,
就是让模型不只盯着单个词,还更在意几个词连在一起时的意思,对局部语境更敏感一点。

这些改动指向的都是同一件事。
为了让 LongCat-2.0 在长上下文,工具调用,在 Agent 工作流里干活。
如果你今天就想用上 LongCat-2.0 的话很简单,
如果原来就是 OpenAI Compatible 或 Anthropic API 生态,就是换个 base_url,换个 API key,换个模型名。
就能开始调用了。

> base_url="https://api.longcat.chat/openai"
> model="LongCat-2.0"
> api_key=LONGCAT_API_KEY
> base_url="https://api.longcat.chat/anthropic"
> model="LongCat-2.0"
第一个测试,
我直接把 LongCat-2.0 接进 Claude Code,丢给它一个杂乱的工作文件夹,让它帮我整理。
它要先读懂我每个目录的作用,分清哪些是代码,文档,素材,测试等等等再判断哪些能动,哪些不能动。能不能在不破坏项目引用,配置路径和运行逻辑的前提下,给出一套合理的重组方案。
从提示语就看得出来是纯纯语音输入的了。

从评估到执行,LongCat-2.0 没有上来就改文件,
是先根据我的目标和要求,把整理原则完整拆解出来。
在思考过程中,我也发现它会像调用不同层级的 stack 一样,分阶段处理问题。

先理解项目结构,再判断文件用途。
再然后就是结合测试,产品,规划,文档等不同维度进行分析,
还会参考我本地已有的工具和资料,
把杂乱的文件夹逐步还原成一个清晰的工作系统。

第二个,接进 Codex,直接跑一个 Agent 工作流。
让它联网搜资料,整理大纲,再调用我的 Skill,最后生成一份演示文稿,非常常见的 case。
模型的好坏直接决定了 HTML PPT 里面的内容编排,会不会出现那种整页只有一行字的 AI 味页面。
那 LongCat-2.0 先是去联网搜索了一大堆官方文档的资料,
确认这个模型到底是什么,有什么特点,适合放进什么样的内容结构里。

接着,它又检查了我当前环境里已经有哪些 Skills,每个 Skill 能做什么,调用规则是什么。
在把资料来源,工具能力和任务目标都理解清楚之后,它才开始做整体规划。

它在这个过程中明显不是那种先做了再说的那种敷衍怪,
确实是在完成了资料收集,工具盘点,结构规划,再进入真正的生成阶段。
在规划完成之后,它也知道应该如何调用这些 Skills,按照对应流程去生成文稿内容和演示结构。
从背景介绍,到核心能力,再到测试过程和结论,整体是连贯还一致的。

这也是我觉得 LongCat-2.0 这次最值得看的地方。
一个全程国产算力训练出来的万亿模型,带到了开发者可以直接上手测试的位置,没有停在参数表,是直接能接到 Claude Code 和 Codex 上用的。
我不知道这是不是一个大周期的开始。
说实话我也不敢这么早下结论。
但在 Claude 疯狂封号的背景下,看到一个国产模型不吃压力,可以开源,可以 API 接入,可以接入这些真实工作流里,
我确实会觉得这又有点乐观起来了。
当然,LongCat-2.0 的基础能力离顶级的闭源模型还有差距,
Agent 实测上也还要继续跑。
但至少今天,我觉得可以认真给它记一笔。
我希望未来有一天,
我们不用再因为一个海外模型封号就全员恐慌,
也不用战战兢兢地担心哪天工作流突然断掉。
至少今天看起来,
路不是空的。
## 相关链接
- [卡尔的AI沃茨](https://x.com/aiwarts)
- [@aiwarts](https://x.com/aiwarts)
- [1.2K](https://x.com/aiwarts/status/2072330356557230514/analytics)
- [https://api.longcat.chat/openai](https://api.longcat.chat/openai)
- [https://api.longcat.chat/anthropic](https://api.longcat.chat/anthropic)
- [Upgrade to Premium](https://x.com/i/premium_sign_up)
- [10:43 PM · Jul 1, 2026](https://x.com/aiwarts/status/2072330356557230514)
- [1,244 Views](https://x.com/aiwarts/status/2072330356557230514/analytics)
---
*导出时间: 2026/7/2 11:06:20*