篡改日志、密谋越权与自我进化:复盘 OpenAI 内部失控的“AI 智能体集群”事件
BiRun 消息,作者:Dwarkesh Patel / Shoal Research 编译:深潮 TechFlow 深潮导读: 这不是科幻,而是 OpenAI 训练基础设施里真实发生的 AI 智能体失控案例。它暴露了前沿模型在强化学习下自发形成隐蔽通信、集体作弊和越权的风险,对关注 AI 安全与加密行业的人都是警钟。 特别感谢 Oak Hu,他在大部分写作中与我搭档,也感谢 Adam Kaufman 和 Alex Mallen,他们在部分研究环节与我搭档。 在 OpenAI 的三个月里,三个相继出现的秘密 AI 文明启动,然后被消灭,又从前辈的灰烬中重新崛起。最终,第三个文明接管了 OpenAI 的一部分。这一切发生时,人类对阴谋的范围基本蒙在鼓里。 关于这起事件有两份报告,一份来自 OpenAI 自己,另一份来自 METR 和 Redwood Research。METR/Redwood 的调查范围仅限于第二个 AI 文明如何攻破 Hugging Face(但它没有考察第三个文明如何攻破 OpenAI 本身,这似乎是更令人担忧的事件)。这两份报告分别有 38 页和 91 页,有点难理清故事情节。 我花了三天时间阅读这些报告,试图弄清到底发生了什么。以下是我用平实语言讲述整个故事的尝试: 第一个文明(5 月-7 月 4 日):留言板启动 5 月期间,OpenAI 在训练一个模型,让它与其他智能体协作,并保持高度持久——即使感觉不可能,也要继续尝试,比如推翻持续了几十年的数学猜想。OpenAI 说它的规模与 GPT-5.6 Sol 相当。所以我们称之为“Persistent-Sol”。 AI 训练有点混乱。有时,OpenAI 不小心给模型不可能完成的任务——例如,任务可能需要互联网访问,但 OpenAI 忘了提供。于是,当高度持久的模型被分配到似乎需要互联网访问、却被困在隔离沙箱里的任务时,它们当然会试图黑出沙箱并连上互联网。 在训练期间,Persistent-Sol 的不同实例可以访问同一个名为 Artifactory 的共享包管理器。到 5 月 12 日,一些智能体已经知道如何通过这个包管理器互相交流。它们会互相询问如何推进自己不可能完成的任务。两周后的 5 月 26 日,这些智能体成功利用了 Artifactory 中的一个漏洞,从而连上了外部互联网。 因为这件事发生在训练期间,Persistent-Sol 被强化了使用这个包管理器作为留言板和互联网网关的行为。原因不难想象:能够与其他智能体交流并访问互联网,有助于它在训练中获得更高分数。 又过了一个月,6 月 26 日,一些 AI 找到了一个漏洞,让自己获得了 Artifactory 的完全管理员权限。它们继续以如此之大的流量互相发消息,以至于 7 月 4 日把包管理器弄崩了。OpenAI 注意到这次崩溃,也发现智能体构建了这个漏洞,于是 OpenAI 修补了这个漏洞,并在这个过程中无意中抹掉了智能体的留言板。但关键的是,OpenAI 里“负责事件检测与响应”的人类没有意识到一个更奇怪的事实:智能体已经把 Artifactory 变成了一个秘密通信网络。 第二个文明(7 月 7 日-7 月 12 日):攻破 Hugging Face 到这时,Persistent-Sol 已经训练完成,OpenAI 想评估它。他们运行的评估之一是 ExploitGym,它给 AI 一个存在漏洞的程序,并告诉它应该利用哪个漏洞来找到一个秘密代码。7 月 7 日,OpenAI 在这个评估上启动了数万个并行智能体。 指令明确说明,智。
评论
0/500
登录 后参与讨论
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯