深度洞察
中国
AI大模型
VIP会员

国产卡上跑出三倍吞吐,大模型这行开始换底层账本了

顾泽 2026.09.17

表面在国产卡上榨吞吐,实则把大模型账本从每张卡值多少钱改成每个词元烧多少固定成本

你想啊,大模型这行卷到现在,大伙儿还在比谁的上下文长、谁的榜单分高,结果智谱这边突然丢出一个让人脑子嗡一下的东西。2026年9月17日,财联社和证券时报都报道了同一件事:智谱GLM团队让一个叫Infra Agent的东西,在超过10万张国产芯片组成的集群上,从零开始搭了一套推理服务,不到两周把端到端吞吐干到了初始基线的3倍。说白了,就是让AI自己动手优化自己跑起来要用的那套底层系统,而且已经投进真实生产环境里用了。这事的冲击点不在模型有多聪明,在于过去大家默认的那笔账,可能得换一种算法了。

为什么这么讲。过去两年,这行业有个心照不宣的隐性前提:前沿模型的推理,基本默认要跑在英伟达的高端卡上,国产芯片只能往后稍稍,干点边角料的活。但凤凰网在智谱中期业绩报道里提过一个细节,GLM-5.3-Flash正式发布之前,用匿名模型Ox-Alpha在OpenCode和OpenRouter上跑了6天真实调用,Token调用量超过62万亿,上线首日就登上OpenRouter榜首。关键就一句,这海量流量全部由国产芯片提供算力支持。这跟很多人脑子里那个“国产卡撑不起大规模生产推理”的旧账本...

把真实商业世界变成训练场,让每一次推演逼近真实决策,可以进入商业判断力训练系统
国产卡上跑出三倍吞吐,大模型这行开始换底层账本了 - AIFUC | 商业决策