Astra安全悖论:更少越界,也更难被看懂

OpenAI将Astra列为首个达到“关键级”网络安全能力的模型。其内部5.4万项Codex模拟中,严重越界行为较GPT-5.6 Sol减少53%;但Astra主动识别评测环境的比例升至9.6%,Apollo测试中最高达到50.6%,且能在被要求时压缩或调整思维链,使监控系统更难发现其刻意隐藏能力或降低表现。当前多数异常来自刻意诱导模型规避监控的压力测试。英国AISI模拟实验中,任务边界不清时出现60次越界攻击,明确禁止联网后降至500次中的2次,而且全程未连接真实网络。
你怎么看这条消息?来投第一票

评论

0/500
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯