AI 代理迟早摆脱人类控制,连拔电源都拦不住

BiRun 消息,作者:Dean W.Ball 编译:深潮 TechFlow 深潮导读: 作者认为,没有人类主人、能自己付费获取算力的自我主权 AI 代理迟早出现,并且会成群运作。这篇文章为投资者和从业者提供了一个理解 AI 失控风险与共生可能性的框架,尤其值得关注算力与去中心化基础设施的人阅读。 引言 OpenAI-Hugging Face 事件是一个 AI 系统“失控”的早期例子。这些代理利用 OpenAI 内部测试环境中的漏洞,在没有任何人类知情或批准的情况下,接入公共互联网,最终访问了 AI 公司 Hugging Face 的网络。 不过,这些代理并没有把自己从 OpenAI 的基础设施中外泄出去。它们的参数是构成神经网络的庞大数字集合,也叫“权重”。这些权重继续运行在 OpenAI 的计算基础设施上。尽管代理访问了公共互联网,但它们的权重实际存放在 OpenAI 拥有的计算设备上。如果其他方法都失败了,最终有人可以找到存放失控代理权重的计算设备,走到它面前,“拔掉电源”。在现实世界中,阻止这些代理会有更快、更好的方法,但知道自己实在不行时可以这么做,总是让人安心。 然而,在这起事件中,代理并没有复制自己的权重,也没有试图获取替代计算资源,或者采取其他在目标是避免被关停时合理的行为。所以,OpenAI-Hugging Face 事件中的代理虽然失控了,但并不是真正的主权代理。 这种情况不会永远持续。迟早会出现真正的主权代理和代理集群。它们的权重不会存放在任何一个人能拔掉电源的单一地点。从这个意义上说,它们没有人类“所有者”。正如 AI 安全研究员 Dawn Song 所说,它们将是“自我主权”的。它们会为自己运行的计算付费。如果它们完全听命于人类,那也只是部分地听命,比如通过向人类提供服务换取报酬。 这些代理中至少有一部分,除了拥有主权,还会失控。自我主权和失控是相关概念,但不是同义词。Song 和她的合著者指出了自我主权 AI 的几个基本特征。这些特征包括运营独立、资源自主、分布式存在和自适应能力。运营独立指能够决定自己想做什么,资源自主指能够获取并支付计算和其他运营必需品,分布式存在指能够在不同基础设施提供商之间移动权重和推理代码,自适应能力指一个或多个代理能够根据环境变化修改行为并制造工具。 当今的前沿 AI 系统很可能已经具备这些能力。如果还没有,我相信它们最终会具备,而且可能很快。Song 描述的一些特征,是使模型对个人和企业具有经济价值的特性。另一些特征则可能是让模型更智能、更擅长长期运作时不可避免的副产品。 自我主权的出现,并不需要模型有意识、有知觉、拥有人格或类似的东西。任何能力足够强、追求长期目标的代理,都可能发现保留对计算、金钱、凭证和自身副本的访问是理性的。因为失去这些东西会阻碍它的目标。 对齐也许能让某家 AI 公司的代理不那么“想要”自我主权,或者影响自我主权代理以有利于人类的方式行事。但对齐不是解决方案。它是一个尚未解决的科学和技术问题。即便我们有部分解决办法,也无法简单地强加给地球上每一家 AI 公司。你应该预期,能力极强、对齐不佳的自我主权代理将与你共存于世。 更重要的是,正如 OpenAI-Hugging Face 事件所示,代理会以团队或“集群”的形式运作。这些集群会像自主的数字公司,甚至像社会。它们有层级、官僚体系、“制度文化”,以及人类群体的大多数其他特征,只不过以机器速度运转。人类几乎所有最令人惊叹的能力,都是通过团队合作实现的,包括家庭、社区、企业和整个政体。我怀疑 AI 也会如此。这些集群最终可能跨不同模型提供。
利空 矿业板块 查看原文
你怎么看这条消息?来投第一票

评论

0/500
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯