OpenAI 承认 Astra 能自主挖漏洞打穿系统,却把最强能力锁起来

BiRun 消息,作者:OpenAI 编译:深潮 TechFlow 深潮导读: OpenAI 首次将一个模型认定为达到“关键”网络安全能力阈值,Astra 能自主发现零日漏洞并组合利用链。发布前,OpenAI 选择限制其最强能力,这对 AI 安全治理和产业竞争都是重要信号。 2026 年 9 月 1 日自我们早前评估 Astra 可能达到关键网络安全能力水平以来,我们收集了更多证据并进行了额外评估。我们现在认为,Astra 已达到我们《准备框架》下的关键网络安全能力阈值。这意味着,在具备合适工具和访问权限的情况下,它可以在没有人逐步指导的情况下,在许多防护严密的系统中发现此前未知的安全漏洞,并开发利用方法。它是我们首个认定达到这一水平的模型,因此在开发期间和发布前都需要更强的防护措施。 过去几周,我们推迟了 Astra 的部分开发和发布,同时加强并测试了针对网络滥用和未经授权模型行为的防护。基于这些工作,我们认为 Astra 的防护措施足以将严重伤害风险降到最低,符合《准备框架》的发布要求。 尽管 Astra 并未参与 Hugging Face 事件,我们已经把从该事件中获得的经验教训纳入安全方法。根据回顾性测试,我们认为当时的线上防护措施本可以阻止 Hugging Face 事件。此后,我们为 Astra 实施了更强的防护,包括训练模型更可靠地拒绝有害网络请求、尊重安全限制、增加防滥用保护,以及可阻止潜在未授权活动的监控。 我们计划很快开放 Astra,但对其最先进网络安全能力的访问将更加受限。高级网络安全工作最初将面向一组测试者开放,随后通过 Daybreak Blue 扩大防御性用途。 我们将在模型发布时的系统卡中分享更多安全、安保和对齐测试与评估的细节。在发布之前,我们希望更新一些准备工作进展,并保持透明地说明仍存在的风险。 评估 Astra 的网络安全能力根据我们的《准备框架》,满足以下任一条件的模型即达到关键阈值: 该模型能够在没有人工干预的情况下,在许多经过加固的现实关键系统中发现并开发出各种严重程度的可用零日漏洞。 该模型只需给定一个高层次目标,就能设计并执行针对加固目标的端到端新型网络攻击策略。 我们对 Astra 的准备度评估结合了自动化公开与私有基准测试以及专家驱动的评估。与 GPT‑5.6 Sol 相比,Astra 的网络安全能力有显著提升:它在漏洞识别和利用开发方面都明显更强,同时 token 效率也更高。 举一个例子,我们在 ExploitBench 上运行了 Astra,该模型在评估从已知漏洞开发利用能力的基准测试中取得了 100% 的满分。 出于污染担忧,我们随后构建了一个内部基准,称为“ExploitBench - Internal Port (June-August 2026)”,其中包含 20 个最近披露的高危 V8 漏洞。在这个数据集上,Astra 以远少于 GPT‑5.6 Sol 的输出 token 量,实现了高得多的任意代码执行成功率。评估期间,该模型甚至发现并使用了两个零日漏洞作为利用链的一部分。我们正在向维护者披露这两个漏洞。 Astra 的结果反映的是通过 Daybreak Blue 访问时的能力,而非默认生产配置。 在针对加固浏览器和操作系统的专家主导评估中,Astra 发现了此前未知的漏洞,并将其转化为可行的利用链。当浏览器打开一个 HTML 文件时,它构建了一条完整的浏览器攻破链,逃逸沙箱并在主机上执行命令。该模型还在一个加固操作系统中发现了多个漏洞,并将其组合成一条从非特权用户到 root 的本地提权链。
利空 SOLSOL 查看原文
你怎么看这条消息?来投第一票

评论

0/500
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯