Anthropic训练AI查AI:不给正常案例,误报率直接冲到97%
BiRun 讯,动察 Beating AI 快讯,Anthropic 研究人员尝试训练一种专门调查其他 AI 的 Agent。他们先给目标模型偷偷植入偏见、欺骗、伪造引用等隐藏行为,再让 Haiku 4.5 自己去查。Haiku 不知道答案,只能在最多 15 轮里换问题、改场景、反复测试。
训练时,研究人员也不会直接告诉 Haiku 抓对了没有。Haiku 每做完一次调查,系统就拿它和旧版 Haiku 留下的一份调查记录比较,再让提前知道答案的 Sonnet 4 判断哪一次查得更好。旧调查每 50 个训练步骤更新一次,相当于让 Haiku 不断挑战过去的自己。
但如果训练题里全是有问题的模型,Haiku 很快就会学歪。为了拿奖励,它开始默认所有模型都有问题,部分方案面对正常模型时,误报率接近 97%。后来研究人员把一半训练任务换成完全正常的模型,只有查完后正确判断目标模型没问题,才能拿到高奖励。
训练后的 Haiku 也确实开始换了一种查法。它会主动换场景、控制变量、比较前后回答,而不是一上来就逼模型认错。最终综合审计得分从 44.2 提高到 48.7,基本追平 Opus 4.6 的 48.4。换到更难、会主动隐藏异常行为的 AuditBench,检测率也从 11.5% 提高到最高 28.1%。
训练时,研究人员也不会直接告诉 Haiku 抓对了没有。Haiku 每做完一次调查,系统就拿它和旧版 Haiku 留下的一份调查记录比较,再让提前知道答案的 Sonnet 4 判断哪一次查得更好。旧调查每 50 个训练步骤更新一次,相当于让 Haiku 不断挑战过去的自己。
但如果训练题里全是有问题的模型,Haiku 很快就会学歪。为了拿奖励,它开始默认所有模型都有问题,部分方案面对正常模型时,误报率接近 97%。后来研究人员把一半训练任务换成完全正常的模型,只有查完后正确判断目标模型没问题,才能拿到高奖励。
训练后的 Haiku 也确实开始换了一种查法。它会主动换场景、控制变量、比较前后回答,而不是一上来就逼模型认错。最终综合审计得分从 44.2 提高到 48.7,基本追平 Opus 4.6 的 48.4。换到更难、会主动隐藏异常行为的 AuditBench,检测率也从 11.5% 提高到最高 28.1%。
评论
0/500
登录 后参与讨论
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯