本文章内容均有可靠的信息来源,相关信源加在文章结尾。
DeepSeek V4这一脚,正踹在黄仁勋最疼的地方
大家好,我是时间煮墨。
4月24日,DeepSeek-V4预览版正式上线并开源。大多数人关注的是它百万上下文的记忆能力、Agent任务处理能力,以及相比GPT-5.4便宜50倍的API定价。但V4真正让整个AI产业界震动的,是技术报告中一行不起眼的说明:DeepSeek-V4已经在华为昇腾平台上完成原生适配,预计下半年随着昇腾950超节点批量上市后,Pro版价格将大幅下调。
仅仅9天前,黄仁勋在一档播客里说过一句话:“如果DeepSeek先在华为平台上发布,那对我们国家来说将是灾难性的。”当时很多人觉得他在危言耸听。但9天后,这个“假设”精准应验。华为昇腾CANN官方在V4发布当天通过直播宣布,V4已在昇腾平台完成首发。
同一天,英伟达技术博客紧急发文,宣布DeepSeek V4已在Blackwell平台完成适配,并晒出实测数据。措辞专业,数据齐全,但发布的节点之急迫,把焦虑暴露得一览无余。
这不是一场普通的商业竞争。被一个中国AI模型捅破的,是英伟达苦心经营了近二十年的护城河。
什么才是英伟达真正的护城河?
过去两年,黄仁勋一直苦口婆心劝告美国:“如果中国不能从美国购买高端芯片,他们就会自己建造。”但劝告无果,他只能眼睁睁看着英伟达在中国的市场份额一路下滑——从2024年的70%降到了2025年的55%。黄仁勋曾自嘲地说“份额从95%跌到了0%”,嘴上自嘲,心里的账算得比谁都清楚。
但让黄仁勋真正睡不着觉的,从来不是少卖几块GPU。
在播客里,主持人追问得很直接:DeepSeek是开源的,理论上可以运行在任何加速器上,即便它在华为昇腾上首发,在英伟达GPU上同样能跑,区别到底在哪里?黄仁勋的回答泄露了真正让他介意的东西——“假设它是针对华为优化的,针对他们的架构化了,那就会让我们处于劣势。”
这句话精确暴露了一个真相:英伟达真正害怕的,不是中国做出好模型,而是好模型不再以CUDA生态作为默认优化起点。
CUDA是什么?可以这样理解:如果说英伟达GPU是“电脑主机”,CUDA就是“Windows系统”。过去近二十年,几乎所有主流AI框架、算子库、开源模型的首发优化,都把CUDA作为默认起点。全球92%的深度学习训练任务依赖CUDA加速库。超过450万开发者已经习惯了在CUDA上写代码、开发应用。他们所有的学习成本、项目代码、工程经验,全都有英伟达的印记。
这条生态护城河的运转逻辑非常简单:只要新模型先在CUDA上调通跑顺,那么哪怕华为、谷歌TPU、AMD MI300在纸面上单卡性能不差,它们在客户那里也只能是“备选方案”。因为迁移意味着重写算子、重做精度校准、重新调参——有业内测算指出,非英伟达平台上开发周期可能延长6个月,成本增加40%。
“事实标准”的地位一旦建立,就会自我强化:越多人优化CUDA,CUDA上跑得越好;越多人在CUDA上做研究,新工作自然继续落在CUDA上。英伟达不怎么操心谁家的AI强不强,只关心他们的AI在不在自家生态里。
DeepSeek V4为什么是“灾难”?
去年DeepSeek发布R1推理模型时,英伟达股价也曾单日蒸发近6000亿美元,创下美股历史最大单日个股蒸发纪录。但当时黄仁勋对外没有一点慌乱,反而宣称DeepSeek及其开源推理模型带来的能量“令人无比兴奋”,并笃定这种技术创新反而会带来更多算力需求。他确实有底气——R1再怎么惊艳,终究是跑在英伟达GPU上,活在CUDA生态里。
V4的情况完全不同了。它在技术报告中明确写入了华为昇腾NPU与英伟达GPU的并列验证,底层代码从CUDA重写为华为自研的CANN框架。这是首个在昇腾平台上原生适配的前沿大模型,意味着至少存在一条真实、可运行、被顶级模型验证过的非CUDA路径,并且这条路径上会沉淀下一批熟练的工程师、一套可复制的优化经验,以及第一批用户信心。
这才是黄仁勋那句“灾难性”的真实分量:不怕某一款芯片被替换,怕的是“开源模型必须以CUDA为首要优化目标”这条默认规则出现第一个公开的反例。
更让英伟达紧张的是后续连锁反应:V4发布后,寒武纪、海光信息以及摩尔线程等国产AI芯片主流厂商,都在第一时间宣布了对DeepSeek V4的适配支持。英伟达正逐渐从国产大模型的“必选项”清单中退场。当最先进的算法不再依赖特定芯片,原有的技术护城河便开始出现裂痕。
“芯海战术”与便宜的瓦特
坦率地说,华为昇腾的单卡性能和英伟达旗舰产品仍有差距——SemiAnalysis的估算显示,单卡性能差距大致在三倍左右。但华为选择的不是单卡硬拼,而是系统工程层面的群体战术。
华为CloudMatrix 384超节点,把384颗昇腾芯片通过高速互联堆叠在一起,集群BF16总算力达到300 PFLOPS,约为英伟达GB200 NVL72旗舰集群的1.7倍,HBM总容量更是后者的3.6倍。功耗代价确实惊人——整体功率近560千瓦,相当于英伟达同级方案的近四倍。但黄仁勋自己在播客中也承认:如果电足够多、足够便宜,单瓦性能这个参数就不再那么重要,你可以用成熟制程的芯片来弥补不足。而中国可再生能源装机全球第一,这个“便宜的瓦特”足以部分吸收功耗劣势。
2025年9月华为全联接大会上,徐直军公布了更激进的路线图:Atlas 950超节点规模8192卡、2026年四季度上市;Atlas 960超节点15488卡、2027年四季度上市。DeepSeek V4明确给这颗还没量产的芯片站台,等于提前预定了一条国产算力的快车道。
“这一步非走不可”
科大讯飞是一个耐人寻味的缩影。明知迁移成本极高——用英伟达方案一个月能完成的任务,迁移到昇腾可能需要三个月——但其董事长刘庆峰直言:“这一步非走不可。”
因为历史反复证明了一个道理:爹有娘有,不如自己有。
IDC发布的2025年中国AI芯片市场数据显示:国产AI加速卡出货量已达165万张,市场份额约41%。其中华为以81.2万张出货量断层领跑,占国产总出货量的49.2%;阿里平头哥、百度昆仑芯、寒武纪紧随其后。中国AI芯片已完成从“样品”到“商品”的实质性跨越。
DeepSeek V4带来的变化并不张扬,但意义深远。它没有宣布要替代谁,只是公开了一行字:下半年,昇腾950。这行字的潜台词是:英伟达的芯片和CUDA生态,不再是中国顶尖AI的唯一入口。
黄仁勋口中的“灾难”,是一层附着在美国商业利益上的锁链被扯下了一个关键的环。而对中国的AI产业来说,这不过是漫漫长征路上一个不期而至的里程碑。
V4发布稿的结尾,DeepSeek引用了这样一句话:“不诱于誉,不恐于诽,率道而行,端然正己。”这句话说的是不被赞誉诱惑,不被诽谤吓到,按自己认定的道往前走。放在今天的语境里读,更像是一份沉默而坚定的宣言。
我是时间煮墨,一个喜欢在科技和商业的缝隙里点一盏灯的人。如果你也对AI产业格局的变迁感兴趣,欢迎在全网搜索“时间煮墨”,我们同名平台见。你认为国产算力从“能用”到“好用”,还需要多长时间?评论区聊聊你的看法。
参考文献:
[1] 凤凰网科技. 心智观察所:如果DeepSeek选择华为,黄仁勋说的“灾难”到底是什么?,2026-04-21.
[2] 中时新闻网. 黄仁勋预言灾难成真?DeepSeek V4舍弃辉达导入华为晶片,2026-04-26.
[3] 快科技. 首发被华为抢了!英伟达急眼:当天火速官宣适配DeepSeek V4,2026-04-25.
[4] C114通信网. 华为昇腾与DeepSeek-V4深度适配:黄仁勋口中的“灾难”,正在变成现实,2026-04-24.
[5] 36氪. 黄仁勋说这是“灾难”:DeepSeek在华为芯片上跑通了,2026-04-24.
[6] IDC. 2025年中国AI芯片市场报告,2026-04.
[7] 新浪科技. 黄仁勋:假设DeepSeek是针对华为优化的,将使我们处于劣势,2026-04-17.
[8] OFweek维科号. 尴尬了,你以为英伟达在中国份额为0%,实际还有55%,2026-04-03.
[9] 通信世界网. Token时代,国产AI芯片迎新局,2026-04-08.
[10] 东方财富网. 国产算力突破:从芯片替代到系统架构创新,2026-04-09.