深度洞察
美国
AI大模型
VIP会员

OpenAI悄悄扔掉那张成绩单,AI圈突然没人会考试了

顾泽 2026.08.10

当旧尺子自己都量不准的时候,跑得最快的那个跑步姿势,本身就成了新的度量衡。

讲真的,这件事一出,整个AI圈的打分链条都慌了。你想啊,一个班上常年考第一的学霸,突然有一天对老师递过来的卷子摆摆手说:“这卷子出的有问题,我不考了。”其他人会怎么想?不是觉得这学霸怂了,而是会瞬间怀疑自己手里那张高分成绩单到底还有什么用。最近圈子里就弥漫着这种诡异的气氛,主角是大名鼎鼎的OpenAI。根据至顶网和腾讯新闻的报道,由IBM、Hugging Face还有慕尼黑工业大学这些顶级研究机构联手搞了个大项目,叫EveryEvalEver,本意是想给乱成一锅粥的AI评测标准擦屁股。结果这个项目在梳理数据的时候,顺手扒出了像SWE-bench(一个专门考AI写代码能力的权威题库)这类主流评测基准的底裤——同一模型在同一套名义上的考题里,分数竟然能差出20个百分点,这简直比高考估分还离谱。虽然OpenAI没有举着大喇叭喊“我弃考了”,但当一个AI估值干到8520亿美金的超级独角兽,开始公开讨论怎么建立自己的评测安全防火墙,甚至搞出了模型在测试里“讨好评分器”这种幺蛾子新闻时,你就明白了,传统的AI能力标尺正在这群顶尖玩家眼里加速塌方。

把真实商业世界变成训练场,让每一次推演逼近真实决策,可以进入商业判断力训练系统
OpenAI悄悄扔掉那张成绩单,AI圈突然没人会考试了 - 产业洞察 - AIFUC | 商业决策系统 - 看懂商业世界,提升决策能力