---
title: "CUDA铁幕裂开！DeepSeek V4换装华为昇腾，万亿参数大模型跑通国产算力"
date: 2026-07-16
category: 算力芯片
site: 脑机网
canonical: https://aiai.cafe/a/njw-bafe26
language: zh-CN
---

# CUDA铁幕裂开！DeepSeek V4换装华为昇腾，万亿参数大模型跑通国产算力

> 2026年春天，中国AI产业完成了一件此前被认为"不可能"的事——DeepSeek V4从底层架构到模型权重，全面迁移至华为昇腾芯片，成为全球首个完全脱离英伟达

2026年春天，中国AI产业完成了一件此前被认为"不可能"的事——DeepSeek V4从底层架构到模型权重，全面迁移至华为昇腾芯片，成为全球首个完全脱离英伟达CUDA生态的万亿参数大模型。这不再是"国产芯片能跑小模型"的试探，而是顶级旗舰模型在国产算力上的全栈落地。CUDA构筑二十年的护城河，第一次被从内部撕开了一道口子。

过去两年，几乎所有国产大模型都长在英伟达GPU和CUDA生态之上。代码、算子、训练流程全部绑定英伟达，形成难以挣脱的路径依赖。DeepSeek V4的迁移被业内形容为"万米高空换发动机"：不是简单移植，而是涉及底层架构、核心算子、精度优化的全栈重构，从CUDA框架切换到华为CANN框架。这一步走通，意味着"国产算力无法支撑前沿大模型"的质疑被彻底推翻。

DeepSeek V4：1.6万亿参数跑在昇腾上

DeepSeek V4于2026年4月24日发布预览版、5月全面开源，采用双版本布局。V4-Pro总参数约1.6万亿、每token激活约490亿，性能对标GPT-5.5；V4-Flash总参数2840亿、激活130亿，主打轻量化与低成本。两者均标配百万Token上下文，原生支持多模态。

硬件基础是华为昇腾系列——昇腾A2、A3及950系列已全面完成适配，其中昇腾950PR成为V4的主力推理硬件。据华为披露，基于V4-Pro在8K输入场景下，昇腾950超节点TPOT约20毫秒；V4-Flash单卡Decode吞吐最高可达4700 TPS。更关键的是，寒武纪、海光信息、摩尔线程、沐曦、百度昆仑芯、阿里平头哥等国产芯片在发布当天即完成"Day0"适配，模型发布即上线，不再需要调试周期。

国产替代加速：预算天平正在倾斜

产业链协同正在加速。彭博行业研究7月发布的调研显示，覆盖金融、互联网、高端制造、政企算力四大领域60家头部企业中，未来12个月46%的AI芯片采购预算将投向本土厂商，而目前这一比例仅为30%——国产芯片采购规模即将接近翻倍。IDC数据则显示，去年国内数据中心加速卡市场中国产算力占比34.6%，预计今年上半年已超四成。

华为CloudMatrix 384超节点用384张昇腾芯片实现业界最大规模高速总线互联，FP16吞吐量比英伟达NVL72高出约40%，成为国产算力的标杆工程。

背景：H20的"去而复返"

把时间拨回2025年7月15日，英伟达获准恢复H20芯片对华销售。H20是Hopper架构末端产品，算力大幅缩水，仅适用于推理和中等规模训练，无法满足万亿参数模型训练需求。但正是在那三个月禁售期内，国内AI产业没有停摆，反而加速了国产替代进程——等到H20"去而复返"时，DeepSeek V4已经证明：没有它，照样能跑世界级大模型。

核心观点：自主可控不可逆转

H20的回归更像一次"末代狂欢"。对国内从业者而言，真正的底座不是某一款解禁芯片，而是全栈自主的技术能力。当DeepSeek V4跑在昇腾上的那一刻，CUDA的铁幕就已经裂开——这道裂缝只会越来越大，不会因为某一款产品的进出而闭合。

2026.07.16

---

来源：脑机网（https://aiai.cafe/）｜原文：https://aiai.cafe/a/njw-bafe26
本内容仅供参考，不构成投资建议。
