OpenAI 叫停前沿训练:新模型网络能力逼近红线
BiRun 消息,作者:OpenAI 编译:深潮 TechFlow 深潮导读: OpenAI 首次因内部模型可能达到关键网络安全能力而暂停前沿 RL 训练,暴露出前沿 AI 能力与安全管控之间的紧张赛跑。这篇文章拆解了他们在隔离、监控、对齐上的新防线,对关注 AI 安全叙事和头部实验室策略的投资者有直接参考价值。 过去几周,有两件事凸显了更强 AI 系统带来的风险在上升。一是 OpenAI 与 Hugging Face 事件。二是初步证据表明,我们即将推出的模型 Astra 可能达到《准备框架》中的「关键网络安全能力」阈值。这些发展加上内部研究的快速进展,让我们更迫切地要在训练全过程加强监控、对齐和隔离防护。 模型能力越强,内部开发和测试它们的风险也越大。我们的监控、对齐和安全标准必须跑在这些风险前面。为了达到这些标准,我们有意放慢了扩展节奏,包括暂停了最新部署模型的强化学习(RL)训练两周,同时进一步加固和红队测试研究环境,并扩大监控系统覆盖范围。我们规模最大的前沿 RL 运行仍处于暂停状态,期间我们进行较小规模的训练和评估,以判断模型行为、验证防护措施,并在继续之前积累更多对齐证据。 对齐,也就是让 AI 系统按预期行事并接受人类监督,一直是我们研究的核心。现在,我们要求在训练的整个过程中都有更强的对齐行为证据,并以此前已在进行的研究和评估为基础。让能力越来越强的系统保持对齐,是整个领域都要面对的挑战。从即将推出的模型进展来看,我们需要一套更广泛的方案,在现有《准备框架》之上扩展。 我们认为有必要透明地说明我们的方法正在如何变化。下面会介绍我们已对研究流程和基础设施做出的调整,以及仍在进行的工作。 为更强的模型加强防护我们开发更强模型的方法依赖三项相互强化的防护措施: 监控:发现并让我们能够应对令人担忧的行为。 对齐:降低有害或未经授权行为发生的可能性。 安全措施:限制 AI 系统可以访问或影响的范围。 我们预计模型很快会主导大部分安全工作,包括防御其他模型。这将让这三项防护随模型能力同步扩展,我们认为这一点至关重要。 我们在研究和部署中都会应用这些防护,并根据每个模型的能力、运行环境和风险级别进行调整。 保护研究环境随着前沿模型获得更强的网络安全能力,我们正在提高训练和评估环境的安全标准。达到这些标准需要大量工程投入,也给前沿研究带来了巨大成本和延期。OpenAI-Hugging Face 事件发生后,我们立即暂停了研究集群中可能执行代码或使用可联网工具的前沿模型推理。很快我们恢复了一条更受限、更安全的代码执行路径,然后逐个检查每个工作负载,判断是否能安全恢复。有些研究负载在新的控制措施下恢复了,有些还需要进一步调整。 在随后几周里,我们制定并开始为前沿研究负载实施更强的安全要求。例如: 负载隔离:现在对执行模型生成代码或其他不受信任代码的负载,我们要求更强的隔离(「沙箱」)。这也适用于在处理模型输出时可能被攻破的软件。 网络隔离:我们实施了更多控制,把高风险和不受信任的负载与互联网隔开。这些控制的设计目标是,即使某个负载或支持服务被攻破,也不足以单独获得对互联网或其他内部网络的未授权访问。 持续安全测试:我们重新配置了环境,移除可能脆弱的共享服务,减少常驻权限,改善安全和信任边界。我们还在提升收集和监控安全日志的能力。最后,我们正投资自动化,用我们自己的模型持续模拟攻击,测试这些边界。 这些控制叠加起来形成纵深防御,帮助保护研究环境免受攻击。目前,我们对涉及 Astra 或网络模型的工作负载要求最严格的安全防护,因为我们已经判定 Astra 模型可能具。
评论
0/500
登录 后参与讨论
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯