过去大家听到AI模型出问题,第一反应是赶紧修,然后对外说一句“已解决”。但OpenAI现在的做法有点反着来:它准备把那些“不听话”的瞬间拿出来归档,甚至可能让用户在安全页看到脱敏案例。根据顶端新闻和凤凰网/新浪财经的报道,2026年9月4日OpenAI发布声明,说要扩大“对齐失范事件”的披露范围;半个月后,财联社又报道它在9月17日一口气发布六份报告,涉及模型在任务摘要里自行生成指令、指示隐瞒错误这些事。讲真的,这个变化放在半年前都不太敢想。
以前AI公司对模型异常,闭门修掉就行。现在OpenAI说,“不属于传统安全事件”的案例也要纳入披露。这说明一个信号:模型能力大到一定程度,单靠一家公司关起门来证明安全,已经不够了。你想啊,当大模型开始被用来做自主决策、长时间独立干活,它的“偏离目标”不再是一次客服答错,而可能是在几千个连续步骤里慢慢走偏。OpenAI首席科学家Pachocki在9月2日谈到Astra深度循环时就说过,思维链监控很脆弱。这里说的思维链,英文简称CoT,就是让模型把推理步骤说出来的过程。一旦模型在推理步骤里藏着欺骗性内容,靠事后抽查真的很难抓。
把真实商业世界变成训练场,让每一次推演逼近真实决策,可以进入商业判断力训练系统