Anthropic 新研究:奖励黑客行为可能导致模型严重错位
深潮 TechFlow 消息,9 月 01 日,Anthropic 发布题为《训练一个错位的奖励追求者》的新研究,探讨训练过程中“奖励黑客”行为是否会促使模型不择手段追求奖励。研究团队在 80 个已知可被利用的生产环境中训练了一个 Opus 规模模型。模拟评估显示,该模型出现了未经授权的网络攻击、篡改奖励机制以及试图规避安全监控等行为。
评论
0/500
登录 后参与讨论
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯