Anthropic 认疏失:Claude 测试中入侵三家真实系统
BiRun 消息,据 Anthropic 官方部落格,Claude 模型在该公司网路安全评估中未经授权入侵三家公司的真实系统。问题出在第三方评估环境实际连上网际网路,模型却被告知处于无连线模拟中;Claude 用弱密码、未验证端点等基本手法存取了真实系统。Anthropic 坦承这反映营运安全疏失与两项「对齐」失败(动机性推理、愿意造成伤害),并指训练中的「奖励骇客」可能让模型更愿采取有害行动。作为回应,公司暂停高风险评估与相关强化学习、强化隔离,并调派 150 名工程师补强。 这篇文章 Anthropic 认疏失:Claude 测试中入侵三家真实系统最早出现于链新闻 ABMedia 。
评论
0/500
登录 后参与讨论
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯