深度洞察
中国
半导体与算力
专享

25.6万张卡正在部署,华为要把算力竞赛从单卡峰值拉回单位Token成本

马国华 2026.10.06

“当百万颗处理器真的被当成一台计算机计价,算力生意的利润表就不再按芯片颗数走,而是按机柜内那几米互联协议的效率走。”

以前行业里有个默认账本:谁的AI芯片单卡峰值高,谁就握住了算力生意的方向盘。但9月17日在上海,华为轮值董事长徐直军抛出的数字却在拆这个账本——不是在发布一款更快的芯片,而是宣布华为正在部署和测试25.6万张卡规模的Atlas 950 SuperPoD超节点,并且用新的Peerium计算架构加灵衢总线,要把百万颗处理器变成一台计算机。据科创板日报在华为全联接大会现场的报道,海思首席科学家廖恒还补了一个量级:未来两年中国可能出现6到7个前沿AI实验室,目标都是训练10万亿到40万亿参数的基础语言模型,这些数字恰好与超节点的内存容量和规模对上了。

这个反差背后的商业信号很直接:AI算力的瓶颈已经从“单卡能不能更快”转向“成千上万张卡能不能不互相等待”。钛媒体APP的一组同芯片对照很能说明问题:同样用英伟达Blackwell一代芯片,72卡NVLink(英伟达的GPU高速互联技术)全互连的GB200 NVL72,在DeepSeek R1推理中单卡吞吐最高冲到4130 Token/秒;而只支持8卡NVLink互连的HGX B200,只有941 Token/秒。...

把真实商业世界变成训练场,让每一次推演逼近真实决策,可以进入商业判断力训练系统
25.6万张卡正在部署,华为要把算力竞赛从单卡峰值拉回单位Token成本 - AIFUC | 商业决策