脑机网 脑机网LOGIC.WANG
ESC

单节点塞进4096张卡,华为这次解决的到底是哪道坎?

9月17日,华为在昇腾产业峰会上发布昇腾 960 超节点,官方给出的关键指标是:基于"灵衢+Hi-ONE"架构,单节点可扩展至 4096 卡规模,提供 8 EFLOPS FP8 算力,并称其为全球首个采用 NPO 光引擎的超节点产品。

2026-09-18 · 999 字 · 脑机网

9月17日,华为在昇腾产业峰会上发布昇腾 960 超节点,官方给出的关键指标是:基于"灵衢+Hi-ONE"架构,单节点可扩展至 4096 卡规模,提供 8 EFLOPS FP8 算力,并称其为全球首个采用 NPO 光引擎的超节点产品。

要理解这个发布,得先说清楚"超节点"在解决什么问题。

瓶颈已经不在单卡

大模型训练早就不是一张卡的事了。当模型规模跨过十万亿参数,训练必然要拆到成千上万张卡上并行。这时候决定效率的,往往不是单卡算力,而是卡与卡之间搬运数据的速度。

一个简单的类比:一群人合作解题,如果每个人都很聪明但互相说话要等半天,整体效率就会被沟通拖垮。卡间互联就是那条通信线。

昇腾 960 的解法是用 5500 个 Hi-ONE 光引擎替换传统电互联,官方称功耗降低超过 550 千瓦,可用度达 99.8%;多个超节点连接后,最大可支持 100 万卡规模的集群。

550 千瓦不是小数字。一个万卡集群的功耗动辄以兆瓦计,互联部分省下的电,直接转化成可部署的算力密度。

配套的还有时间表

华为同时给出了产品节奏:昇腾 960DT 提前三个季度、2027 年一季度就绪,970 与 980 分别定档 2028、2029 年。

这个节奏表比单次发布更能说明问题——它意味着路线图已经排到三年后,而不是临时应对。

华为副总裁张熙伟在会上透露,今明两年昇腾的研发投入已超过无线产业部门;目前昇腾超级节点部署超 1000 套,累计超 6.5 亿在线卡时,已有 40 多个大模型完成预训练。他还给出一个测算:国内约 10 家头部厂商的大模型训练算力需求合计约 200 万卡,对应算力投资规模可达数千亿乃至上万亿元。

另据会上信息,昇腾目前供不应求,并对海外销售作出限制。

算力竞争换了个维度

把视角拉高一点:同一周的花旗人工智能基础设施峰会给出的判断是,AI 基础设施的瓶颈正从单纯堆算力转向系统级优化。随着模型进入推理和长上下文工作流,网络互联、内存带宽与数据传输效率成为关键。博通认为以太网将成为大规模基础设施的首选互联方案,可节省超 30% 的五年总拥有成本;三星则预计新一代内存可带来 4 至 8 倍的单 GPU 性能提升。

几件事指向同一个结论:堆卡的阶段正在过去,系统级工程正在成为新的主战场。

这对国内厂商未必是坏消息。单卡制程受制于人,但系统级工程、光互联、集群调度这些环节,拼的是工程能力与迭代速度,恰恰是可以靠投入和时间换来的部分。

4096 卡一个节点真正的含义是:竞争的单位从"一颗芯片"变成了"一台机器"。

查看「AI大模型」更多内容 → · 返回首页