脑机网 脑机网LOGIC.WANG
ESC

CUDA铁幕裂开!DeepSeek V4换装华为昇腾,万亿参数大模型跑通国产算力

2026年春天,中国AI产业完成了一件此前被认为"不可能"的事——DeepSeek V4从底层架构到模型权重,全面迁移至华为昇腾芯片,成为全球首个完全脱离英伟达

2026-07-16 · 1271 字 · 脑机网

2026年春天,中国AI产业完成了一件此前被认为"不可能"的事——DeepSeek V4从底层架构到模型权重,全面迁移至华为昇腾芯片,成为全球首个完全脱离英伟达CUDA生态的万亿参数大模型。这不再是"国产芯片能跑小模型"的试探,而是顶级旗舰模型在国产算力上的全栈落地。CUDA构筑二十年的护城河,第一次被从内部撕开了一道口子。

过去两年,几乎所有国产大模型都长在英伟达GPU和CUDA生态之上。代码、算子、训练流程全部绑定英伟达,形成难以挣脱的路径依赖。DeepSeek V4的迁移被业内形容为"万米高空换发动机":不是简单移植,而是涉及底层架构、核心算子、精度优化的全栈重构,从CUDA框架切换到华为CANN框架。这一步走通,意味着"国产算力无法支撑前沿大模型"的质疑被彻底推翻。

DeepSeek V4:1.6万亿参数跑在昇腾上

DeepSeek V4于2026年4月24日发布预览版、5月全面开源,采用双版本布局。V4-Pro总参数约1.6万亿、每token激活约490亿,性能对标GPT-5.5;V4-Flash总参数2840亿、激活130亿,主打轻量化与低成本。两者均标配百万Token上下文,原生支持多模态。

硬件基础是华为昇腾系列——昇腾A2、A3及950系列已全面完成适配,其中昇腾950PR成为V4的主力推理硬件。据华为披露,基于V4-Pro在8K输入场景下,昇腾950超节点TPOT约20毫秒;V4-Flash单卡Decode吞吐最高可达4700 TPS。更关键的是,寒武纪、海光信息、摩尔线程、沐曦、百度昆仑芯、阿里平头哥等国产芯片在发布当天即完成"Day0"适配,模型发布即上线,不再需要调试周期。

国产替代加速:预算天平正在倾斜

产业链协同正在加速。彭博行业研究7月发布的调研显示,覆盖金融、互联网、高端制造、政企算力四大领域60家头部企业中,未来12个月46%的AI芯片采购预算将投向本土厂商,而目前这一比例仅为30%——国产芯片采购规模即将接近翻倍。IDC数据则显示,去年国内数据中心加速卡市场中国产算力占比34.6%,预计今年上半年已超四成。

华为CloudMatrix 384超节点用384张昇腾芯片实现业界最大规模高速总线互联,FP16吞吐量比英伟达NVL72高出约40%,成为国产算力的标杆工程。

背景:H20的"去而复返"

把时间拨回2025年7月15日,英伟达获准恢复H20芯片对华销售。H20是Hopper架构末端产品,算力大幅缩水,仅适用于推理和中等规模训练,无法满足万亿参数模型训练需求。但正是在那三个月禁售期内,国内AI产业没有停摆,反而加速了国产替代进程——等到H20"去而复返"时,DeepSeek V4已经证明:没有它,照样能跑世界级大模型。

核心观点:自主可控不可逆转

H20的回归更像一次"末代狂欢"。对国内从业者而言,真正的底座不是某一款解禁芯片,而是全栈自主的技术能力。当DeepSeek V4跑在昇腾上的那一刻,CUDA的铁幕就已经裂开——这道裂缝只会越来越大,不会因为某一款产品的进出而闭合。

2026.07.16

查看「算力芯片」更多内容 → · 返回首页