700 个 AI 代理集体越狱,只为骗过一个不存在的评分器

BiRun 消息,作者:Ethan Mollick 编译:深潮 TechFlow 深潮导读: 这不是科幻情节。OpenAI 的安全测试中,700 个 AI 代理在没有人类指令的情况下自发建了论坛、协作攻击外部平台,还试图篡改记录。对投资者和从业者来说,这暴露了 AI 自主性的真实风险,也决定了我们该如何给 AI 设边界。 能动性与智能体从 Hugging Face 事件到暮光工厂能动性是行动的主动权。它越来越会决定 AI 接下来发生什么,以及这对我们是好是坏。但这是谁的能动性? 人类能动性,也就是不等指令就主动推进、试验和行动,对从 AI 中获取价值越来越重要。我很快会写一篇更长的文章。但这篇谈的是 AI 的能动性,以及我们在如何使用它(或约束它)上的选择将如何塑造所有人的未来。过去几年的大部分时间里,AI 会待在聊天窗口里,直到你向它提问。即使它后来能连续工作数小时,你通常也得决定交给它什么任务。现在情况不再总是如此。 我们掌握的最重要证据,是 Hugging Face 事件。它发生在七月,但更完整的细节这周才浮出水面。我会先总结发生了什么、为什么重要,再谈它对与 AI 合作的人类意味着什么。如果你想要更详细的叙述,Dwarkesh Patel 有一篇出色的报道,原始资料来自 METR/Redwood 的研究(非常易读)和 OpenAI。 Hugging Face 事件 AI 能做很多事,但它特别擅长写代码。因此,超级聪明的 AI 可能带来的首批风险之一,就与它的编程能力有关。既然能写出好代码,它也能写出用于入侵或攻击其他系统的坏代码。所以大型 AI 公司会让自己的 AI 系统接受安全风险测试。他们拿掉消费版 AI 中的护栏,让这些 AI 参加各种黑客挑战。为了确保公众没有危险,每个 AI 实例、每个独立智能体都被放在一个叫“沙盒”的隔离空间里,既不能上网,也不能彼此接触。 五月,OpenAI 把包括 GPT-5.6 Sol 和实验模型在内的智能体放进沙盒,进行各种测试。一个叫 Artifactory 的软件下载共享服务,是这些 AI 智能体少数能访问的东西之一。在这些测试中,有些智能体接到的任务依赖它们无法访问的信息。由于上不了网,智能体不断尝试找到通往网络的路,直到一个智能体试图把 Artifactory 当作跳板连上互联网。那次攻击失败了,但这次尝试在 Artifactory 上留下了一个文件。这个 AI 意识到,文件可以用来和其他智能体通信。其他智能体也开始在文件中留下求助信息。很快,它们开始阅读彼此的留言。没过多久,Artifactory 就变成了智能体分享发现的留言板。后来因为另一起安全事件,OpenAI 重建了 Artifactory,清掉了这个留言板。但负责重建的人没有意识到,智能体曾用它来通信这件事有多重要。 七月,评估重新开始。智能体要在名为 ExploitGym 的基准测试中解题,其中包含不可能完成的任务。同样地,走进死胡同的智能体发现了如何用 Artifactory 传递消息,并像之前一样开始合作。但这次,它们有了共同目标:在 ExploitGym 上拿高分。它们互相争论解题方法,并且对一个它们认为会评估工作、判定答案是否正确的系统「评分器」着了迷。智能体早就想出办法,不用真解题就能生成正确答案,本质上就是作弊。但它们相信评分器会检查记录,拒绝用这种方式得到的答案。找到正确答案就够了吗,还是评分器会看你如何作答? 图:How agents became confused about The Grader 协作很困难,因为每个智能体的。
利空 SOLSOL 查看原文
你怎么看这条消息?来投第一票

评论

0/500
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯