2026年8月31日,36氪和观点新媒体同时提到一份中国信通院人工智能研究所的检验报告。报告里有个数字看着特别反常:上海原点星辉科学技术有限公司研发的StartLux-V1.0-27B-Preview,在“可信AI大模型基准测试——MCP专项测试”里综合得分39.25,排名第二;排第一的DeepSeek-V4-Pro参数量是1.6万亿,它只有270亿。参数量差了将近60倍,综合分差距只有大约1%。报告显示,这是国内首个采用“AI训练AI”方法做后训练的本地Agent模型,而且能在消费级个人电脑上跑。事情本身不大,但数字背后透着点意思。
我想先把账本摊开看。一个27B的模型为什么能贴着一台1.6T的旗舰走?如果答案只是“榜单刷得好”,那这个故事就不值得聊。真正值得聊的是:一家长三角的初创公司,手里没有万卡集群,没有自研芯片,也没有云厂商的算力池,凭什么敢在信通院的正式检验里和DeepSeek的Pro级产品正面对账,而且还只在单项上拿第一。这里面没有魔法,只有算力约束下被逼出来的效率账。