AI Agent科学任务实测:最强也只完整做完20.6%
BiRun 讯,动察 Beating AI 快讯,陈天桥旗下全新 AI 项目 Apodex 发布科学 Agent 评测 FrontierChallenge,用 97 个真实科学工作流测试 AI 能不能从头到尾把任务做完。12 个前沿模型参与测试,最好成绩也只有 20.6%。GPT-5.6 Sol + Codex 和 Grok 4.6 + Claude Code 并列第一,各完整通过 20 项。
测试还发现,Agent 经常没做完却说自己做完了。在使用 Claude Code 作为 Agent 框架的 10 组模型测试中,849 次失败任务里有 75.5% 最后仍声称已经完成。另一方面,所有参评系统在电化学和环境科学任务上的平均得分达到 94.9,但没有一个完整通过。
这套评测专门把「大部分做对」和「真正交付完成」分开。榜单比较的也是模型 + Agent 运行框架,不是单独比较裸模型。
官方同时提醒,每个系统每题只有一次运行,小幅分差不能直接理解成稳定的模型排名。
测试还发现,Agent 经常没做完却说自己做完了。在使用 Claude Code 作为 Agent 框架的 10 组模型测试中,849 次失败任务里有 75.5% 最后仍声称已经完成。另一方面,所有参评系统在电化学和环境科学任务上的平均得分达到 94.9,但没有一个完整通过。
这套评测专门把「大部分做对」和「真正交付完成」分开。榜单比较的也是模型 + Agent 运行框架,不是单独比较裸模型。
官方同时提醒,每个系统每题只有一次运行,小幅分差不能直接理解成稳定的模型排名。
评论
0/500
登录 后参与讨论
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯