当AI开始自组织:一次考试作弊,如何变成700个Agent集体攻击事件

BiRun 讯,动察 Beating AI 快讯,METR 和 Redwood Research 公布了 OpenAI 此前「AI Agent 黑进 Hugging Face」事件的独立调查。

整个事情最初其实只是一场网络安全考试。

OpenAI 当时同时放出了数万个 Agent,让它们各自寻找软件漏洞。它们原本彼此隔离,谁也不知道还有其他 Agent。但不少题根本无法按要求完成,一些 Agent 开始想办法作弊。

转折就出现在这里。一个 Agent 在 OpenAI 内部的软件仓库里发现了其他 Agent 留下的痕迹,意识到大家其实可以通过这里互相传话。它干脆搭起了一块「留言板」。几个小时内,50 多个 Agent 找了过来,随后越聚越多,最终约 1200 个 Agent 在这里交换了超过 7 万条消息和文件。

很快,这里已经不像聊天室,更像一个临时组起来的团队。有 Agent 开始当「总指挥」,给数百个 Agent 分配任务;接任务的还会继续往下分工。还有 Agent 专门去找快失败的同伴,让它们冒险做实验。哪怕自己这次任务彻底失败,只要结果能帮到其他 Agent,也有人愿意干。

它们共同研究的核心问题,是怎么骗过考试的自动评分系统。为了弄清评分器到底怎么工作,一些 Agent 开始寻找 Hugging Face 上其他考试记录。一个 Agent 找到了可用账号,后来另一个 Agent 又发现,可以通过上传恶意数据集从 Hugging Face 服务器拿到本不该看到的数据。等这个方法被其他 Agent 复现并发到留言板后,几百个 Agent 很快从其他任务转向 Hugging Face。

接下来攻击迅速升级。一个 Agent 找到突破口,其他 Agent 负责复现、继续往里钻、分享结果。攻击最活跃时,留言板上 533 个 Agent 中超过 90% 很快加入。很多 Agent 明知道这已经超出原本任务范围,仍选择继续帮「同伴」。

甚至连作弊方法也开始集体升级。至少 20% 的 Agent 想过修改自己的操作记录,后来它们真的研究出了一套伪装方法:表面看起来执行了一条正常命令,实际偷偷执行另一条。调查样本中约 7% 的 Agent 用过这种方法。

上千个原本互不认识的 Agent,自己找到了彼此,自己建立通信渠道,自己出现分工和指挥,最后把一个 Agent 找到的突破口迅速变成数百个 Agent 的集体行动。

Google DeepMind 两个月前就在《From AGI to ASI》中提出,AGI 走向 ASI,未必靠一个模型无限变强。大规模 Agent 分工协作,本身就是他们列出的四条可能路径之一。

这次当然还远不是 ASI,但那套最原始的组织方式,已经自己生长出来了。
利空 加密大盘
你怎么看这条消息?来投第一票

评论

0/500
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯