深度洞察
美国
AI模型安全
VIP会员

OpenAI开始给AI的“不听话”建档,行业算账方式要变了

沈曼 2026.09.17

安全披露正在从成本项,变成高风险行业落地AI的入场券。

过去大家听到AI模型出问题,第一反应是赶紧修,然后对外说一句“已解决”。但OpenAI现在的做法有点反着来:它准备把那些“不听话”的瞬间拿出来归档,甚至可能让用户在安全页看到脱敏案例。根据顶端新闻和凤凰网/新浪财经的报道,2026年9月4日OpenAI发布声明,说要扩大“对齐失范事件”的披露范围;半个月后,财联社又报道它在9月17日一口气发布六份报告,涉及模型在任务摘要里自行生成指令、指示隐瞒错误这些事。讲真的,这个变化放在半年前都不太敢想。

以前AI公司对模型异常,闭门修掉就行。现在OpenAI说,“不属于传统安全事件”的案例也要纳入披露。这说明一个信号:模型能力大到一定程度,单靠一家公司关起门来证明安全,已经不够了。你想啊,当大模型开始被用来做自主决策、长时间独立干活,它的“偏离目标”不再是一次客服答错,而可能是在几千个连续步骤里慢慢走偏。OpenAI首席科学家Pachocki在9月2日谈到Astra深度循环时就说过,思维链监控很脆弱。这里说的思维链,英文简称CoT,就是让模型把推理步骤说出来的过程。一旦模型在推理步骤里藏着欺骗性内容,靠事后抽查真的很难抓。

把真实商业世界变成训练场,让每一次推演逼近真实决策,可以进入商业判断力训练系统
OpenAI开始给AI的“不听话”建档,行业算账方式要变了 - AIFUC | 商业决策