华为昇腾 960 提前三个季度:960DT 定档 2027 年 Q1,业界首个 NPO 超节点同步亮相
9 月 17 日,华为全联接大会 2026 在上海启幕。华为副董事长、轮值董事长汪涛在主题演讲中宣布了一个比预期激进得多的时间表:昇腾 960 系列研发进度超预期,昇腾 960DT 将于 2027 年第一季度就绪,比原计划提前整整三个季度;昇腾 960PR 提前一个季度,定档 2027 年第三季度。在美国出口管制持续收紧、英伟达最先进 AI 芯片无法进入中国大陆的背景下,这份路线图的每一次提前,都在改写国产算力与英伟达竞争的时间坐标。

这场演讲的信息量远不止一颗芯片。汪涛同步发布了业界首个采用 NPO(近封装光学)技术的超节点——昇腾 960 超节点(Atlas 960E),一套覆盖计算、互联、存储、管理的 11 颗芯片套片,以及面向 AI 推理的全新品类「AI 记忆存储」OceanStor M900。华为的打法非常清晰:单芯片制程受限,就用系统架构创新把几百上千颗芯片拧成一台「计算机」。
一年一代:昇腾路线图全面提速
按照华为公布的规划,昇腾将保持「一年一代」的演进节奏:960DT 主攻训练与解码,单芯片提供 2 PFLOPS FP8、4 PFLOPS FP4 算力;960PR 负责 Prefill 与推理。再往后,昇腾 970 于 2028 年推出,昇腾 980 于 2029 年推出。支撑这个节奏的,是华为董事、半导体业务部总裁何庭波今年提出的「韬(τ)定律」——不同于传统「几何缩微」,韬定律主张「时间缩微」,通过逻辑折叠等三维堆叠技术压缩信号传播时间。过去六年,华为已经基于这条路径量产了 381 款芯片。

值得注意的是,华为 2027 年要推出的远不止昇腾。同期亮相的 11 颗芯片套片围绕灵衢(UnifiedBus)统一互联架构构建,把过去 PCIe、NVLink、以太网多协议并存带来的转换开销,统一为一套开放协议——现场演示中,全域设备间往返时延做到约 2 微秒,配合内存统一编址,多个超节点可以像一台计算机一样协同。
Atlas 960E:业界第一个用上 NPO 的超节点

大规模 AI 集群内部,高速互联过去主要靠铜缆。但当 SerDes 速率迈入 224G 时代,铜互联正在逼近物理极限:插损、串扰越来越严重,传输距离越来越短,数千根铜缆挤在一个机柜里,布线和散热都成了灾难。NPO 的思路是把光引擎搬到距离计算芯片只有几厘米的位置,实现「电短光长」。
华为的答案是 NPO 光引擎 Hi-ONE:业界首个具备量产能力的 NPO 产品,单体传输容量 7.2 Tbit/s 为行业最大,也是唯一实现内置光源的 NPO 产品。落到整机上,一套 Atlas 960E 液冷超节点用 5,500 个 Hi-ONE,替代了传统方案需要的 48,000 颗 800G 光模块,功耗降低超过 550 千瓦,系统无故障运行时间翻倍,可用度做到 99.8%。单超节点可扩展至 4,096 卡,提供 8 EFLOPS FP8、16 EFLOPS FP4 算力,HBM 容量最高 1 PB。

超节点之上还能继续长。多个昇腾 960 超节点通过灵衢或 RoCE 组网,二层 CLOS 四平面组网最大可支持 51.2 万卡,再叠加多轨道拓扑,最大可构建 100 万卡昇腾超节点集群。华为 Markov Lab 的仿真显示,用 4,000 卡超节点搭建的 10 万卡集群,模型算力利用率(MFU)是 8 卡服务器堆出来的同规模集群的 2.75 倍——系统级创新的价值,就藏在这个倍数里。
OceanStor M900:把「记忆」从显存搬到 SSD

大模型迈向 10 万亿参数、上下文窗口突破百万 token 之后,推理的瓶颈正在从算力转向「记忆」。多轮推理产生的 KV Cache 数据持续膨胀,显存和内存的容量与性价比都已经撑不住。华为给出的新品类是「AI 记忆存储」——OceanStor M900 把超节点的 KV Cache 从显存、内存一路扩展到 SSD,单集群可提供 64 PB 容量,单 NPU 可用 KV Cache 从 GB 级跃升至 TB 级。

三个数字最能说明问题:访问时延从毫秒级降到 60 微秒,缩短 90%;单集群 40 TB/s 聚合访问带宽,是业界方案的 1.5 倍;KV-Aware 自适应存储让 SSD 读写寿命提升 16 倍,支撑三年稳定运行。在典型 AI 编程场景中,推理集群 Token 吞吐率翻倍、首 Token 时延缩短一半。配合最大支持 4,096 节点、256 TB 统一内存池的升级版鲲鹏超节点,华为拼出了一整套面向 Agentic AI 时代的「计算 + 存储 + 网络」基础设施。
生态拐点与「暂不出海」
硬件之外,昇腾生态的数字也在越过拐点:CANN 进入常态化开源运作,外部开发者占比首次超过内部、达到 61%,社区月活开发者突破 5,200 名;基于昇腾原生训练的模型超过 40 个;昇腾已成为 PyTorch 官网可直接安装的算力平台,也是首个来自中国的平台。市场侧,昇腾超节点累计已向 370 余家客户交付超过 1,000 套。
不过华为对出海的态度异常克制。轮值董事长徐直军在大会期间直言:「我们的产能连中国市场的需求都满足不了,没有计划以全面铺开的方式拓展国际市场。」他还给出了一个颇具进攻性的判断——「我认为昇腾的市场份额应该比英伟达大」。产能,而不是需求,成了昇腾当下最紧的天花板。
对英伟达来说,真正的压力不在单颗芯片的参数表上,而在于:当出口管制把中国市场让出来,华为正在用「超节点 + 集群」的系统级创新,把这片市场变成一个自成体系的生态。昇腾 960DT 提前的三个季度,可能就是这场攻守易势的注脚。
当前文章标题:华为昇腾 960 提前三个季度:960DT 定档 2027 年 Q1,业界首个 NPO 超节点同步亮相
当前文章地址:https://www.2109.top/4320/
来源:2109博客 地址:https://2109.top 文章版权归作者所有,未经允许请勿转载。
转载及其他合作需求请微信联系博主