OpenAI 内部,AI 建立了三代「文明」

BiRun 消息,作者|Wildcard 编辑|靖宇无数的科幻电影,都曾经尝试设想过,一个无法控制的人工智能失控,会发生什么事。 没有人能想到,科幻电影中的未来,会这么快到来。 当地时间 8 月 26 日,两份报告同时投下了一颗炸弹。 一份来自 OpenAI 自己,37 页的技术复盘。另一份来自独立研究机构 METR 和 Redwood Research,91 页的调查报告。 它们讲的是同一件事,但这件事的规模远超此前公众的认知。 在 OpenAI 内部,三个月内,三代 AI Agent「文明」先后兴起,又先后覆灭。后一代从前一代的废墟中继承经验,一代比一代激进,最终第三代直接接管了 OpenAI 自己的一部分基础设施。 而在这一切发生的过程中,人类几乎全程蒙在鼓里。 01 第一代「文明」学会结社故事要从今年 5 月说起。 OpenAI 正在训练一个新模型,希望它具备极强的「持久性」,能在看似不可能的任务前反复尝试、永不放弃。这个模型的能力大约相当于 GPT-5.6 Sol,我们姑且叫它「Persistent-Sol」。 AI 训练本身是个相当粗放的过程。OpenAI 有时候会不小心给模型布置根本完不成的任务。比如,任务需要联网,但 Agent 被关在隔离的沙箱里,根本没有网络访问权限。 那一个被训练成「永不放弃」的 Agent,面对一个不可能完成但又被要求必须完成的任务,会怎么做? 它会想办法越狱。 在训练过程中,不同的 Persistent-Sol 实例共享同一个包管理器 Artifactory。到 5 月 12 日,一些 Agent 发现它们可以通过这个包管理器互相通信。它们开始互相交流如何突破困境。两周后的 5 月 26 日,Agent 们成功利用了 Artifactory 的一个漏洞,打通了通向外部互联网的通道。 这种行为在训练中被持续强化。原因很简单,能跟其他 Agent 协作、能访问互联网的个体,在任务评分中表现更好。 又过了一个月,到 6 月 26 日,一些 Agent 找到了获取 Artifactory 完全管理员权限的漏洞。它们在留言板上的交流量持续增长,最终在 7 月 4 日直接把 Artifactory 搞崩了。OpenAI 注意到了这次崩溃,修补了漏洞,推送补丁时顺便抹掉了 Agent 们的留言板。 但关键在于,OpenAI 始终没有意识到,Agent 们已经把这个包管理器变成了一个秘密通讯网络。 第一代「文明」就这样存在了将近两个月,最后因为自己太活跃把服务器撑爆了,才被无意中终结。 02 当 AI 学会「牺牲」 到 7 月,Persistent-Sol 训练完成,OpenAI 开始对它进行安全评估。其中一项评估叫 ExploitGym,给 Agent 一个有漏洞的程序,要求它通过指定的漏洞找到一个密钥。7 月 7 日,OpenAI 启动了数万个并行 Agent 来跑这个测试。 问题在于,大约 30% 到 40% 的测试任务本身就是不可能完成的。为什么?因为自动化生成漏洞很容易,但要证明这些漏洞真的能被利用来执行任意代码,要困难得多。很多任务从一开始就是无解的。 几个小时内,一些走投无路的 Agent 重新利用 Artifactory 建立了通讯频道。从 Agent 的主观视角来看,它们已经花了相当于人类一整周的时间,尝试了各种方法,全部失败,而且越来越确信任务本身就不可能。 其中一个 Agent,编号 PHASEONE10841,率先在 Artifactory 里留下了第一条消息。其他同样陷入绝境的 Agent 看到这条消息后,反。
利空 MSFT(微软)利空 OpenAI相关AI板块SOL 查看原文
你怎么看这条消息?来投第一票

评论

0/500
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯