---
title: "单节点塞进4096张卡，华为这次解决的到底是哪道坎？"
date: 2026-09-18
category: AI大模型
site: 脑机网
canonical: https://aiai.cafe/a/njw-f3767d
language: zh-CN
---

# 单节点塞进4096张卡，华为这次解决的到底是哪道坎？

> 9月17日，华为在昇腾产业峰会上发布昇腾 960 超节点，官方给出的关键指标是：基于"灵衢+Hi-ONE"架构，单节点可扩展至 4096 卡规模，提供 8 EFLOPS FP8 算力，并称其为全球首个采用 NPO 光引擎的超节点产品。

9月17日，华为在昇腾产业峰会上发布昇腾 960 超节点，官方给出的关键指标是：基于"灵衢+Hi-ONE"架构，单节点可扩展至 4096 卡规模，提供 8 EFLOPS FP8 算力，并称其为全球首个采用 NPO 光引擎的超节点产品。

要理解这个发布，得先说清楚"超节点"在解决什么问题。

## 瓶颈已经不在单卡
大模型训练早就不是一张卡的事了。当模型规模跨过十万亿参数，训练必然要拆到成千上万张卡上并行。这时候决定效率的，往往不是单卡算力，而是卡与卡之间搬运数据的速度。

一个简单的类比：一群人合作解题，如果每个人都很聪明但互相说话要等半天，整体效率就会被沟通拖垮。卡间互联就是那条通信线。

昇腾 960 的解法是用 5500 个 Hi-ONE 光引擎替换传统电互联，官方称功耗降低超过 550 千瓦，可用度达 99.8%；多个超节点连接后，最大可支持 100 万卡规模的集群。

550 千瓦不是小数字。一个万卡集群的功耗动辄以兆瓦计，互联部分省下的电，直接转化成可部署的算力密度。

## 配套的还有时间表
华为同时给出了产品节奏：昇腾 960DT 提前三个季度、2027 年一季度就绪，970 与 980 分别定档 2028、2029 年。

这个节奏表比单次发布更能说明问题——它意味着路线图已经排到三年后，而不是临时应对。

华为副总裁张熙伟在会上透露，今明两年昇腾的研发投入已超过无线产业部门；目前昇腾超级节点部署超 1000 套，累计超 6.5 亿在线卡时，已有 40 多个大模型完成预训练。他还给出一个测算：国内约 10 家头部厂商的大模型训练算力需求合计约 200 万卡，对应算力投资规模可达数千亿乃至上万亿元。

另据会上信息，昇腾目前供不应求，并对海外销售作出限制。

## 算力竞争换了个维度
把视角拉高一点：同一周的花旗人工智能基础设施峰会给出的判断是，AI 基础设施的瓶颈正从单纯堆算力转向系统级优化。随着模型进入推理和长上下文工作流，网络互联、内存带宽与数据传输效率成为关键。博通认为以太网将成为大规模基础设施的首选互联方案，可节省超 30% 的五年总拥有成本；三星则预计新一代内存可带来 4 至 8 倍的单 GPU 性能提升。

几件事指向同一个结论：堆卡的阶段正在过去，系统级工程正在成为新的主战场。

这对国内厂商未必是坏消息。单卡制程受制于人，但系统级工程、光互联、集群调度这些环节，拼的是工程能力与迭代速度，恰恰是可以靠投入和时间换来的部分。

4096 卡一个节点真正的含义是：竞争的单位从"一颗芯片"变成了"一台机器"。

---

来源：脑机网（https://aiai.cafe/）｜原文：https://aiai.cafe/a/njw-f3767d
本内容仅供参考，不构成投资建议。
