DeepSeek V4:一份技术报告里藏着的地震 ✍ 雪踏乌云🕐 2026-04-27📦 13.3 KB 🟢 已读 𝕏 文章列表 本文深入解读了 DeepSeek V4 技术报告,指出其核心意义在于实现了训练系统与硬件的解耦。通过英伟达 GPU 和华为昇腾 NPU 的混合验证,中国 AI 训练从“被卡脖子”的死结转变为时间可解的工程问题。作者认为,这是 AI 算力自主可控的分水岭,改变了产业竞争的根本逻辑。 DeepSeek V4华为昇腾算力自主技术报告硬件解耦AI训练国产芯片产业观察 # DeepSeek V4,一份技术报告里藏着的地震 **作者**: 雪踏乌云 **日期**: 2026-04-27T13:09:46.000Z **来源**: [https://x.com/Pluvio9yte/status/2048751461094597114](https://x.com/Pluvio9yte/status/2048751461094597114) ---  昨天晚上,我在 linux.do 上刷到一个帖子。 标题很长,大意是说 DeepSeek V4 的真正意义不在于价格便宜,而在于中国 AI 从「被卡脖子」走到了「自己爬坡」的拐点。帖子下面 200 多条回复,吵成一锅粥。 有人在争 V4 Pro 到底贵不贵,有人在比 GLM 5.1 的 LMArena 分数,有人用 base64 编码发阴阳怪气的评论被管理员当场正义执行,还有人在讨论华为昇腾的算子库到底能不能用。 我一条一条看完了。 然后我发现一件挺有意思的事,200 多条回复里,大部分人在讨论的东西,和那篇帖子真正想说的东西,几乎是两个世界。 帖子在说一场地震。评论区在讨论震感。 所以我决定自己去读一下 V4 的技术报告。 说实话,我不是做底层训练的,平时用 AI 更多是在应用层面,Codex 写代码,Claude Code跑一些做规划,日常任务,GPT 做一些创意类的东西。看技术报告对我来说不算轻松。 但这次看完之后,我是真的觉得,有些东西值得认真聊一聊。 不是因为 V4 跑分多高,也不是因为 API 多便宜。是因为技术报告里有一段话,大概只有几百个字,但你仔细读完之后会意识到,这几百个字背后的工程含义,可能比所有跑分加在一起都重要。 这段话在技术报告的 §3.1。 我把原文贴出来,你感受一下。 「We validated the fine-grained EP scheme on both NVIDIA GPUs and HUAWEI Ascend NPUs platforms. Compared against strong non-fused baselines, it achieves 1.50 ∼ 1.73× speedup for general inference workloads, and up to 1.96× for latency-sensitive scenarios such as RL rollouts and high-speed agent serving.」 翻译过来就是,他们在英伟达 GPU 和华为昇腾 NPU 两个平台上,都验证了同一套细粒度专家并行方案,跑出了 1.5 到 1.96 倍的加速比。 看起来平平无奇对吧?就是个性能测试结果嘛。 但你想想看,这段话出现在哪。 §3.1,是 V4 技术报告里讲训练系统的章节。不是推理,是训练。 这段话在说的事情,用大白话讲就是,DeepSeek 的训练系统里面最核心、最复杂、最依赖硬件特性的那个部分,专家并行的通信-计算融合内核,在算法和接口层面,已经和具体的硬件解耦了。 它在英伟达的 Hopper 架构上能跑,在华为昇腾的达芬奇架构上也能跑。跑出来的加速比在同一个量级。 这件事的工程含义是什么? 训练框架最核心的部分都跑通了,外围的东西,数据加载、优化器、checkpointing 这些,只会更通用。 也就是说,DeepSeek 已经证明了一件事,他们的训练栈是硬件无关的。 读到这里的时候我停了一下。因为我突然意识到这句话的重量。 「硬件无关」这四个字,在 AI 训练这个语境下,几乎等于在说,以后想在什么卡上训就在什么卡上训。 我知道很多人会说,等等,跑通一个 kernel 不等于整个生态成熟。单卡算力华为还是比不过英伟达。CANN 的文档和适配都还差得远。 这些都对。 但你要搞清楚一件事,这些都是程度问题,不是有没有的问题。 在 V4 之前,中国 AI 训练面对的是什么?是英伟达的卡被禁售了。你有钱也买不到。这不是程度问题,这是有没有的问题。这是死结。 钱解决不了,时间也解决不了。你就是等十年,禁令不撤你也没办法。 V4 之后呢? 中国 AI 训练面对的变成了,华为的卡产能还没上来。昇腾 950DT 要等到今年 Q4 才上市。CANN 生态还在完善。这些当然都是问题,但你注意,这些全都是有时间表的工程问题。 产能可以爬坡。生态可以建设。文档可以补全。 这不是一个解不了的死结了。这是一个在跑的时钟。 死结换成了时钟。 我觉得这才是 V4 真正的划时代意义。不是模型能力有多强,不是 API 有多便宜,是它在技术层面证明了,中国 AI 的训练可以摆脱英伟达。 不是说现在就摆脱了,是说摆脱这件事,从「不可能」变成了「只是时间问题」。 这个性质的转变,比任何跑分都重要。 linux.do 那个帖子的作者说了一句话我印象很深,「中国 AI 不是和美国被拉到同一起跑线,是第一次走出了根本不在跑道上的位置」。 这话听着有点绕,但仔细想想确实是这么回事。 以前争论的是「我们能不能跑」,现在争论的变成了「我们跑得快不快」。这是两个完全不同层面的问题。 那有人可能会问,V4 现在不还在用英伟达的卡训练吗?那你说的这个「硬件无关」到底有多可信? 这个问题帖子里也有人提,而且讨论得挺认真的。 从技术报告的字面意思来看,V4 的实际训练确实是英伟达加昇腾的混合方案。DeepSeek 没有在报告里直接写「我们完全在昇腾上训的」。 但作者指出了几个有意思的佐证。 §3.1 后半段,有一节是对硬件厂商提技术指标要求的,那些指标是训练场景的指标,不是推理场景的。这说明 DeepSeek 在做训练框架设计的时候,已经把硬件抽象掉了,是面向通用硬件在设计,不是面向某一家的卡。 报告里还有一句,「the peak FLOPs for FP4 × FP8 operations can theoretically be implemented to be 1/3 more efficient on future hardware」。这里的「future hardware」,在产业语境下精准对应昇腾 950DT。FP4 原生支持,4 PFLOPS FP4 算力,预计今年 Q4 量产。 然后评论区有人提出了,去翻华为官方的代码仓库 cann-recipes-train,里面已经有了 DeepSeek V4-Flash 在昇腾 A3 集群上做续训练的参考实现。注意那个仓库名,cann-recipes-train,训练。如果只能推理,这个仓库根本不会存在。 所以这是一个双向验证的证据链,DeepSeek 的论文在技术层面做了抽象,华为的工程仓库在实现层面做了适配。两边的信息拼在一起,指向同一个结论。 当然了,坦率的讲,这里面还是有值得谨慎的地方。 有个懂行的网友指出,CPT(继续预训练)和完整的从零预训练不是一回事。华为目前做到的可能更多是 CPT 层面的,要真的从零跑通一个完整的大规模预训练,可能要等 950PR 甚至 960 的硬件。 这个说法有道理。CPT 确实只是预训练的一个子集。 但你想想看,三年前连推理都在昇腾上跑不利索,两年前 CPT 还想都不敢想,现在 CPT 已经跑通了,接下来的完整预训练,那只是量变到质变的最后一步。 这个趋势才是关键。 说到趋势,还有一个更大的图景很少有人提到。 你看美国这边的 AI 基建现在是什么状况。 数据中心建设很多被延迟或取消。原因不是没钱,是没电。 电网、土地审批、环保监管,这些在美国都是结构性的瓶颈。你不是砸钱就能解决的。电网升级要 5 到 10 年,土地审批要走无数流程,环保组织分分钟给你一个诉讼。 反过来看中国这边。 中国的瓶颈是什么?算力卡的产能。 但这是一个有明确时间表的工程问题。华为昇腾 950DT 预计 Q4 量产。国内的电力基础设施远比美国完善。特高压输电网早就铺好了。审批流程。。。你懂的。 帖子作者用了一个我觉得很精准的对比,美国的瓶颈是结构性的,解决要 5 到 10 年甚至无解。中国的瓶颈是周期性的,12 到 24 个月。 这意味着什么? 你想想看,如果中国的产能爬坡只需要 1 到 2 年,而美国的基建问题要 5 到 10 年,那当中国的产能上来的时候,双方的竞争态势会发生什么变化? 中国不缺电,不缺基建,不缺审批效率。以前缺的是卡。现在卡这件事有了自己的解法。 美国不缺卡,英伟达就在自家。但缺电,缺基建,缺审批。这些事没有自己的解法。 两边第一次站到了一个对称的瓶颈面前。海外「有卡缺基建」,中国「缺卡有基建」。谁先解开谁赢。 而从解题难度来看,产能爬坡远比基建重建简单得多。 这不是在唱赢。DeepSeek V4 Pro 的编程能力确实还不如 Claude Opus 4.7 和 GPT-5.5。在 LMArena 的 Code Arena 上被 GLM 5.1 压了 70 分。实际用下来,做 code agent 的场景我个人目前还是首选 Claude Code 或者 GPT-5.5。 V4 现在还是预览版,后训练都没完全做完。距离闭源旗舰模型的能力还有差距。这些都是事实。 算力自主是整个竞争的根基。你模型再强,如果训练用的卡随时可能被禁,那你的一切都建在沙子上。 V4 解决的是根基的问题。能力的问题,会随着迭代自然解决。 这就像什么呢。 你盖一栋楼。以前的情况是,地基的钢材被别人掐着,他说不卖就不卖。你设计图画得再好,地基打不了,楼就盖不起来。 现在的情况是,你找到了自己的钢材来源。质量暂时还差一点,产能也还不够。但你能用了。你可以打地基了。上面楼盖得好不好看,那是后面的事,慢慢来。 至少你不用看别人脸色了。 帖子评论区有个人说了句话,我觉得特别准确,「之前命是在人家手上,人家想让你死,你就很难爬起来。现在是训练和推理都在国产芯片上跑通了,就看自己跑得快不快,反正存活肯定不是问题了」。 存活不是问题了。 这六个字的分量你品一品。 有人可能会觉得我这篇文章太乐观了。那我要说,V4 的技术报告最后引用了一句话,我觉得特别好。 「不诱于誉,不恐于诽,率道而行,端然正己。」 DeepSeek 自己对自己的定位就很清醒。他们没有在报告里大吹大擂说自己多牛逼,没有搞什么「遥遥领先」的话术。他们就是把技术做了,把结果放在论文里,然后继续埋头干活。 评论区有人说梁文锋不造神。我觉得这话说到点子上了。你看 DeepSeek 的每一次发布,从 V2 的 MLA 架构到 V3 的 MoE 创新再到现在 V4 的硬件解耦,每次都是「我们做了什么」「数据是什么」「开源了什么」,然后就没了。不搞发布会,不请明星站台,不在社交媒体上炒作。 这种态度在现在这个环境里真的很稀缺。 我自己做内容的,天天在各个平台上看各种 AI 相关的信息。太多的讨论陷在「A 模型好还是 B 模型好」「这个跑分高还是那个跑分高」的维度里。这些讨论当然有价值,但很容易让人忽视更大的图景。 V4 这件事的更大图景是什么? 是中国的 AI 产业第一次在最核心的训练环节证明了,我们可以不依赖别人。 不是说现在就完全不用了,而是说,不用这件事从技术上已经可行了。剩下的只是产能和工程优化的问题。 这让我想起十几年前的一件事。 2012 年左右,中国的高铁还在被质疑。很多人说核心技术是从日本、德国引进的,说我们只会组装不会创新。动车事故之后更是各种唱衰。 但你看后来发生了什么。我们引进了技术之后,消化了,吸收了,然后在上面做了自己的创新。现在中国高铁的技术已经完全自主可控,还在反向输出到全世界。 AI 算力这件事,可能正在走一条类似的路。 V4 不是终点,它更像是一个分水岭。分水岭的这一边,是「被卡脖子」。分水岭的那一边,是「自己跑」。 我们刚刚翻过了这道岭。 前面的路还很长。华为的产能要爬坡。CANN 的生态要完善。国产卡的单卡算力要追赶。V4 的模型能力也需要后续版本继续迭代。 但方向对了。 方向对了这件事,比什么跑分、什么价格都重要。 DeepSeek V4 技术报告的 §3.1 就几百个字。 但这几百个字改变的东西,可能需要几年才能被完全理解。 最后,如果你目前想免费体验一下DeepSeek V4 Pro,可以试试ZenMux这个平台,目前我发现网页端是完全免费的: 直达链接: DeepSeek V4 Pro(Free):https://zenmux.ai/deepseek/deepseek-v4-pro-free DeepSeek V4 Flash(Free):https://zenmux.ai/deepseek/deepseek-v4-flash-free ## 相关链接 - [雪踏乌云](https://x.com/Pluvio9yte) - [@Pluvio9yte](https://x.com/Pluvio9yte) - [1.8K](https://x.com/Pluvio9yte/status/2048751461094597114/analytics) - [linux.do](http://linux.do/) - [linux.do](http://linux.do/) - [https://zenmux.ai/deepseek/deepseek-v4-pro-free](https://zenmux.ai/deepseek/deepseek-v4-pro-free) - [https://zenmux.ai/deepseek/deepseek-v4-flash-free](https://zenmux.ai/deepseek/deepseek-v4-flash-free) - [Upgrade to Premium](https://x.com/i/premium_sign_up) - [9:09 PM · Apr 27, 2026](https://x.com/Pluvio9yte/status/2048751461094597114) - [1,891 Views](https://x.com/Pluvio9yte/status/2048751461094597114/analytics) - [View quotes](https://x.com/Pluvio9yte/status/2048751461094597114/quotes) --- *导出时间: 2026/4/27 22:13:53*
K Kimi K3 技术报告拆解:全球首个开源 3T 级模型 本文拆解了 Kimi K3 的技术报告,这是一个全球首个开源的 2.8 万亿参数模型。文章详细解析了其混合注意力架构、注意力残差机制、MoE 设计以及在长文本训练和推理优化上的创新。报告指出 K3 性能虽略逊于顶级闭源模型,但在多项任务中表现优异,且具有极高的成本效率,甚至已能辅助团队进行内核优化和芯片设计。 技术 › LLM ✍ Berryxia.AI🕐 2026-07-29 Kimi K3模型架构MoE长文本技术报告开源模型AI芯片内核优化推理加速
哑 哑巴英语用ChatGPT Voice搭一套雅思口语7分AI训练工作流 文章介绍了如何利用ChatGPT Voice功能构建雅思口语训练工作流,无需外教即可模拟考官、实时纠错并按雅思评分维度复盘,通过科学的Part 1-3分段练习和文本反馈,帮助考生突破5.5-6分瓶颈,冲刺7分。 技术 › LLM ✍ Kimberly🕐 2026-07-15 雅思口语ChatGPTAI训练英语学习口语练习教育科技学习效率
开 开源长文转幻灯片 Skill:DeepSeek V4 助力高效精读与复习 作者开源了一款名为 'note-slides' 的 Skill,旨在将长文(PDF、链接等)转换为结构化的幻灯片。该工具模拟资深用户视角,提炼关键思考与洞见,形成总览、展开和总结三部分内容。作者认为 AI 幻灯片提供了“地图视角”,弥补了线性阅读后记忆模糊的短板。目前该工具已针对 DeepSeek V4 模型进行优化,在 Claude Code 中运行成本极低,适合用于长文的快速信息筛选与复习复盘。 技术 › Skill ✍ 小盖🕐 2026-05-07 开源DeepSeekDeepSeek V4Claude Code读书笔记知识管理幻灯片自动摘要阅读效率工具推荐
大 大世之争催生的中国钠电池产业 文章以虚构的能源危机为背景,阐述了中国钠电池产业在储能领域的重要性。详细对比了比亚迪和宁德时代在钠电池技术路线(聚阴离子vs. 能量密度)上的不同策略与博弈。文章指出,凭借资源丰富度、安全性及长循环寿命,钠电池成为中国应对全球能源危机和供应链风险的关键“备胎”技术。 技术 › 电池 ✍ Eason Mao🕐 2026-05-02 钠电池比亚迪宁德时代储能能源安全硬碳聚阴离子新能源供应链产业观察
D DeepSeek V4 + GPT-5.5 一手实战,结果很意外!附 Codex 保姆级项目教程 文章详细记录了使用 GPT-5.5 和 Codex 开发“项目学习助手”全栈应用的全过程,包括后端(FastAPI+LangChain)、前端(Vue)及 DeepSeek V4 API 的接入。文中对比了 Codex 的优缺点,实测了新模型的代码生成能力,并提供了 AI 自主测试与调试的实战技巧。 技术 › Codex ✍ 程序员鱼皮🕐 2026-04-28 GPT-5.5DeepSeek V4Codex全栈开发AI 编程LangChainFastAPIAgent实战教程
本 本周顶级 AI 论文综述:DeepSeek V4 与自进化智能体 本周综述重点介绍了 DeepSeek V4,这是首个默认支持百万 token 上下文的开源模型系列,通过 CSA/HCA 混合注意力机制和领域专家后训练技术,在推理性能上媲美 GPT-5.2。此外,还涵盖了 Apple 的 Mamba 架构知识蒸馏方法、Autogenesis 自进化智能体协议,以及 Skill-RAG 失败感知检索系统。 技术 › LLM ✍ DAIR.AI🕐 2026-04-27 DeepSeek V4长上下文模型架构自进化智能体MambaRAG知识蒸馏论文综述CSAHCA
实 实测DeepSeek V4:为国产化而生的混合模型 文章详细评测了 DeepSeek V4 模型。V4 采用混合架构,参数量达 1.6T,虽未集成多模态能力,但在推理和代码领域表现优异。作者指出该版本通过 MXFP4、TileLang 和 MegaMoE 等技术,深度适配华为昇腾等国产芯片,旨在解决算力卡脖子问题。实测中,V4 在写作和长文本处理上表现出色,但在 Agent 意图识别和复杂开发约束遵守方面仍存在瑕疵。 技术 › LLM ✍ 数字生命卡兹克🕐 2026-04-24 DeepSeek评测国产化大模型AIAgent华为昇腾混合模型技术分析编程
O OpenAI向左,DeepSeek向右 文章深入对比了2026年OpenAI与DeepSeek的发展路径。OpenAI采取高定价、重商业的精装商品房模式;而DeepSeek则坚持开源低价,依托中国电力基建和昇腾芯片,将AI变成水电煤般的免费基础设施。DeepSeek通过转型重资产、引入巨额融资以对抗人才流失,并推行端侧AI与开源生态,在乌干达等全球南方地区实现数字平权,打破了硅谷的算力垄断。 技术 › LLM ✍ Sleepy.md🕐 2026-04-24 DeepSeekOpenAI商业模式开源算力封锁端侧AI数字平权华为昇腾国产大模型行业观察