以前行业里有个默认账本:谁的AI芯片单卡峰值高,谁就握住了算力生意的方向盘。但9月17日在上海,华为轮值董事长徐直军抛出的数字却在拆这个账本——不是在发布一款更快的芯片,而是宣布华为正在部署和测试25.6万张卡规模的Atlas 950 SuperPoD超节点,并且用新的Peerium计算架构加灵衢总线,要把百万颗处理器变成一台计算机。据科创板日报在华为全联接大会现场的报道,海思首席科学家廖恒还补了一个量级:未来两年中国可能出现6到7个前沿AI实验室,目标都是训练10万亿到40万亿参数的基础语言模型,这些数字恰好与超节点的内存容量和规模对上了。
这个反差背后的商业信号很直接:AI算力的瓶颈已经从“单卡能不能更快”转向“成千上万张卡能不能不互相等待”。钛媒体APP的一组同芯片对照很能说明问题:同样用英伟达Blackwell一代芯片,72卡NVLink(英伟达的GPU高速互联技术)全互连的GB200 NVL72,在DeepSeek R1推理中单卡吞吐最高冲到4130 Token/秒;而只支持8卡NVLink互连的HGX B200,只有941 Token/秒。...