你想啊,大模型这行卷到现在,大伙儿还在比谁的上下文长、谁的榜单分高,结果智谱这边突然丢出一个让人脑子嗡一下的东西。2026年9月17日,财联社和证券时报都报道了同一件事:智谱GLM团队让一个叫Infra Agent的东西,在超过10万张国产芯片组成的集群上,从零开始搭了一套推理服务,不到两周把端到端吞吐干到了初始基线的3倍。说白了,就是让AI自己动手优化自己跑起来要用的那套底层系统,而且已经投进真实生产环境里用了。这事的冲击点不在模型有多聪明,在于过去大家默认的那笔账,可能得换一种算法了。
为什么这么讲。过去两年,这行业有个心照不宣的隐性前提:前沿模型的推理,基本默认要跑在英伟达的高端卡上,国产芯片只能往后稍稍,干点边角料的活。但凤凰网在智谱中期业绩报道里提过一个细节,GLM-5.3-Flash正式发布之前,用匿名模型Ox-Alpha在OpenCode和OpenRouter上跑了6天真实调用,Token调用量超过62万亿,上线首日就登上OpenRouter榜首。关键就一句,这海量流量全部由国产芯片提供算力支持。这跟很多人脑子里那个“国产卡撑不起大规模生产推理”的旧账本...