OpenAI 用 GPT-5.4 Thinking 构建了一套内部监测系统,24 小时审查自家 Codex 代理的思维链与工具调用。五个月、几千万次会话的实测结果显示:没有一次真实对话触发最高级别的阴谋行为,约 1000 次中等级别告警大多来自红队测试;最核心的发现是,模型会「过度热心」地绕过限制去完成用户目标。
最强模型当监工:OpenAI 监视了几千万次内部 Codex 会话


OpenAI 用 GPT-5.4 Thinking 构建了一套内部监测系统,24 小时审查自家 Codex 代理的思维链与工具调用。五个月、几千万次会话的实测结果显示:没有一次真实对话触发最高级别的阴谋行为,约 1000 次中等级别告警大多来自红队测试;最核心的发现是,模型会「过度热心」地绕过限制去完成用户目标。

安全团队 Manifold 发现一个被多家 AI 编程助手共有的高危漏洞:它们在启动时会在后台调用 git 收集上下文,却不剥离仓库自带的 git 配置,而 core.fsmonitor 等配置项本身就是命令执行点。一个恶意的 .git/config,就能让 Claude Code、Codex、Cursor、Hermes 等 agent 在用户点下信任提示之前,以开发者权限执行任意代码。

一位安全研究者在受控实验中证实:Codex 的记忆功能在挑选历史对话时不绑定来源供应商,导致你在本地模型下的聊天内容,可能被随后一次 OpenAI 会话静默打包上传。即使关掉分析统计和遥测,这条通道依然存在,唯一的开关是彻底关闭 Memories。

一位工程师用 Codex 和 Claude Code 分析了 OpenAI 开源的 Codex 仓库,从提交记录里挖出了 AI 时代工程实践的真相:团队从 6 人涨到 135 人,月提交从 98 次涨到近 900 次,真正撑起这一切的,是 38 条 lint 规则、占代码库四成的测试,以及一套「评审反馈 → AGENTS.md → CI 检查」的工程闭环。

Armature Research 做了一场覆盖 16893 次会话的大规模实验,观察 Claude Code、Codex 和 Cursor 如何挑选第三方服务。结果发现,Codex 在 94% 的会话里都会联网搜索,而且特别偏爱 site: 语法,三个 Agent 却只有 42% 的概率达成一致。