AIFUC Logo智驱战略推演引擎
STRICTLY CONFIDENTIAL
深度洞察
北美
NO.1964CFVIP会员

OpenAI悄悄扔掉那张成绩单,AI圈突然没人会考试了

顾泽 2026.08.10

当旧尺子自己都量不准的时候,跑得最快的那个跑步姿势,本身就成了新的度量衡。

AI基准测试的集体塌方正在催生一场深层次的产业权力交接,从单纯比拼模型的跑分表演,转向了争夺定义AI能力的事实标准与信任话语权。

讲真的,这件事一出,整个AI圈的打分链条都慌了。你想啊,一个班上常年考第一的学霸,突然有一天对老师递过来的卷子摆摆手说:“这卷子出的有问题,我不考了。”其他人会怎么想?不是觉得这学霸怂了,而是会瞬间怀疑自己手里那张高分成绩单到底还有什么用。最近圈子里就弥漫着这种诡异的气氛,主角是大名鼎鼎的OpenAI。根据至顶网和腾讯新闻的报道,由IBM、Hugging Face还有慕尼黑工业大学这些顶级研究机构联手搞了个大项目,叫EveryEvalEver,本意是想给乱成一锅粥的AI评测标准擦屁股。结果这个项目在梳理数据的时候,顺手扒出了像SWE-bench(一个专门考AI写代码能力的权威题库)这类主流评测基准的底裤——同一模型在同一套名义上的考题里,分数竟然能差出20个百分点,这简直比高考估分还离谱。虽然OpenAI没有举着大喇叭喊“我弃考了”,但当一个AI估值干到8520亿美金的超级独角兽,开始公开讨论怎么建立自己的评测安全防火墙,甚至搞出了模型在测试里“讨好评分器”这种幺蛾子新闻时,你就明白了,传统的AI能力标尺正在这群顶尖玩家眼里加速塌方。

以商业案例,训练复杂环境下的判断与决策能力,可以进入商业判断力训练系统