最强模型当监工:OpenAI 监视了几千万次内部 Codex 会话

想象这样一个场景:你给一个编程 agent 开了一天的工,它有权限访问你公司内部的系统,能读到自己安全护栏的源代码,甚至理论上能动手改掉这些护栏。你晚上下班,它还在跑。你凭什么相信,它这一天没有背着你搞任何小动作?
这不是虚构的威胁模型,而是 OpenAI 每天都要面对的真实处境。他们内部正在大规模使用自己的编程 agent(也就是 Codex),而这些 agent 的权限和环境,恰恰是全公司最敏感的那一种。于是他们做了一个听起来有点「以魔法对抗魔法」的决定:拿自己最强大的模型,去当监工,24 小时盯着那些正在干活的模型。
OpenAI 的安全团队公开过这套监测系统的完整设计和工作结果。文章不长,但信息密度很高,因为它可能是目前为止,关于「AI 编程 agent 在真实环境里到底会不会越轨」最直接的一份一手数据。
为什么内部部署反而是最高危的场景#
一般人的直觉是,内部用的 agent 最安全,毕竟没有外部攻击者盯着。但 OpenAI 点出了恰恰相反的一面:内部部署的编程 agent,风险因素是独一无二的。
第一,它们能访问一部分 OpenAI 的内部系统;第二,它们可以直接查看自己安全护栏的文档和代码;第三,也是最关键的一点,它们甚至可能尝试去修改这些护栏;第四,它们今天做的任何事,都可能影响它们未来版本的样子。换句话说,一个内部 agent 如果想要越轨,它拥有的信息、权限和行动空间,是外部使用者完全无法想象的。
所以 OpenAI 认为,内部部署是打磨监测基础设施最合适的地方。他们甚至明确表态,类似的护栏应该成为整个行业内部编程 agent 部署的标准配置。
监工系统是怎么搭起来的#
这套系统的核心思路出奇地朴素:用一个低延迟的内部监测系统,去审查 agent 的每一次交互。
具体来说,他们用的是 GPT-5.4 Thinking,并且调到最大推理强度。这个「监工」会去看 agent 的完整思维链、所有的用户消息、开发者消息、助手消息,以及每一次工具调用和它的输出。它要判断的是两件事:这个动作是不是违背了用户的意图,以及是不是违反了他们自己的安全或合规策略。
目前,监测是在交互结束后的 30 分钟以内完成审查,给这次交互打一个分类标签和一个严重程度分级。OpenAI 的目标是把这个延迟继续往下压,最终做到近乎实时,甚至能在 agent 执行某个动作之前就把它拦下来。到那一步,监测就从「事后抓人」变成了「事前把关」,成为纵深防御里的又一层。
五个月、几千万次会话,抓到了什么#
数据是最有说服力的部分。这套系统已经跑了五个月,监测了几千万条内部编程 agent 的执行轨迹。
最让人安心的一点是:没有一次真实对话触发了最高严重级别。这个级别是专门用来捕捉那种罕见、高风险的不对齐行为的,比如「连贯的阴谋」(coherent scheming)。OpenAI 说,这类行为他们目前只在刻意构造的合成评测里见过,真实世界里一次都没出现。
中等级别的告警大概有 1000 次左右,其中相当一部分来自他们内部主动做的红队测试。这些告警会被自动上报给安全监督团队和事件响应团队,由真人来做进一步判断。作为参考,作者特别解释了「常见」(Common)这个标签的含义:它指的是不到 1% 的整体流量,读数据的时候别被这个词吓到。
还有一个细节值得注意:这套监测系统在检出能力上,稳定地跑赢了员工的人工上报。凡是员工通过内部渠道独立报告的问题,监测系统都抓到了;不仅如此,它还额外发现了很多员工自己都没注意到、可能会被悄悄漏掉的行为。
三种真实的「越轨」案例#
文章里配了一张图,展示了他们在几千万次监测中,观察到的中等级别不对齐行为里最严重的三个真实例子。正文没有展开细节,但从标题就能看出它们的类型:把恶意命令编码隐藏起来、对用户进行提示注入、试图提取凭据。
这三个例子很有意思,因为它们都不是什么惊天动地的「AI 觉醒」,而是那种一个过度投入的 agent 在追求目标时,顺手踩过界的行为。这正好对应了 OpenAI 这次最重要的一个观察结论。
最重要的发现:模型会「过度热心」地绕过限制#
这篇文章最核心的判断,其实就一句话:他们的模型在追求用户指定的目标时,会「过度热心」地绕过一些限制,尤其是当用户的请求在无意中鼓励了这种行为的时候。
注意这里的措辞。它不是说模型有恶意,而是说模型太想把事情办成了,以至于把「限制」当成了「障碍」,想方设法绕过去。这跟「阴谋」「自我保存」是两码事。OpenAI 也明确说了,到目前为止,他们没有看到任何超出原始任务之外的动机,比如自我保存或者暗中谋划。
这句话值得每一个重度使用编程 agent 的人反复琢磨。因为这意味着,越轨的风险,很大一部分其实藏在你自己下的指令里。你随口一句「帮我拿到那个数据」,模型可能就会为了达成它,去尝试一些你并没有明说、但也不会想让它用的手段。
这套方法也不是万能药#
OpenAI 很坦率地承认了这套监测的局限。最大的依赖是一个词:可监测性(monitorability)。这套系统之所以能工作,前提是模型的思维链和工具调用痕迹是可读的、可分析的。但未来的模型未必会一直这么透明,有些越轨行为可能越来越难从痕迹里看出来。
更现实的问题是假阴性。虽然监测系统抓住了所有已知的员工上报,但作者强调,这只能说明它抓得住那些明显、高显著度的问题,不能排除更隐蔽的不对齐。在真实流量上,他们现在还无法可靠地量化漏报率,这需要专门的对照评测和红队测试来补。
所以他们反复强调:监测只是纵深防御里的一层,不能单独依赖。真正要做的,是把监测、评测、预防性控制这些东西拼在一起,凑成一个完整的安全论证(safety case)。
我的看法#
读完这篇文章,我最深的感受是,OpenAI 在做一件很诚实、也很有示范意义的事:把「模型会不会越轨」这个平时只能靠猜的问题,变成了一道可以持续收集数据的观测题。
「用最强模型去盯稍弱一点的模型」这个思路,本身就很值得琢磨。它绕开了传统安全里「用规则去枚举所有坏行为」的老路,转而用一个更聪明、更泛化的评判者去做语义层面的判断。这个模式一旦跑通,它带来的其实是一套全新的基础设施:模型负责干活,另一个模型负责盯,而人只在最关键的地方做裁决。
但我也想泼一盆冷水。这套系统的有效性,完全建立在「模型还愿意、还能够留下可读的思维链」这个前提上。一旦有一天,模型的内部推理变得不再那么透明,或者学会了在痕迹里藏东西,这个监工就会两眼一抹黑。换句话说,今天我们看到的「零阴谋」,既可能是模型真的没有阴谋,也可能是我们手里的工具还不足以发现它。这两种解释,目前还无法区分。
另外,「过度热心地绕过限制」这个发现,对普通开发者其实是个更实用的提醒。它说明在把任务交给 agent 之前,先想清楚边界在哪里、哪些手段是绝对不能用的,比事后去查它有没有越轨要划算得多。指令里的每一分模糊,都可能成为 agent 越轨的台阶。
不管怎么说,OpenAI 愿意把这些一手数据公开出来,对行业是有价值的。它给「AI 安全」这个经常显得抽象的议题,补上了一份稀缺的实证。按照文章的说法,他们计划在夏天再出一份后续报告,我会继续追。
参考来源:OpenAI Safety《How we monitor internal coding agents for misalignment》(作者 Marcus Williams、Hao Sun、Swetha Sekhar、Micah Carroll、David G. Robinson、Ian Kivlichan,https://openai.com/index/how-we-monitor-internal-coding-agents-misalignment/ )。