Terminal-Bench 3.0换王:Opus 5以43.5%压过GPT-5.6 Sol
BiRun 讯,Terminal-Bench 3.0 最新榜单换王。这个评测让 AI Agent 在真实终端环境里完成任务,最后直接检查结果是否正确。
当前前三名分别是:
1. Claude Opus 5 Max + mini-SWE-agent:43.5%
2. GPT-5.6 Sol Max + Codex:34.6%
3. Claude Fable 5 + Claude Code:34.1%
Terminal-Bench 3.0 在 7 月 23 日上线,目的就是把题重新做难。旧版前沿模型的成绩已经挤在一起,新版本希望重新拉开差距。首版有 74 道任务,覆盖 7 个领域,还加入 GPU、多容器网络等更复杂环境。任务也不只是写代码,还可能要求提交模型权重、形式化证明、电子表格和 CAD 文件。
不过,这不能直接理解成 Opus 5 本身比 Sol 强近 9 个百分点。Terminal-Bench 允许模型搭配不同 Agent 运行,前三名分别用了 mini-SWE-agent、Codex 和 Claude Code。Agent 会决定模型怎么调用工具、执行命令和处理上下文,因此榜单更准确测的是「模型 + Agent」整套系统的能力。
Terminal-Bench 3.0
当前前三名分别是:
1. Claude Opus 5 Max + mini-SWE-agent:43.5%
2. GPT-5.6 Sol Max + Codex:34.6%
3. Claude Fable 5 + Claude Code:34.1%
Terminal-Bench 3.0 在 7 月 23 日上线,目的就是把题重新做难。旧版前沿模型的成绩已经挤在一起,新版本希望重新拉开差距。首版有 74 道任务,覆盖 7 个领域,还加入 GPU、多容器网络等更复杂环境。任务也不只是写代码,还可能要求提交模型权重、形式化证明、电子表格和 CAD 文件。
不过,这不能直接理解成 Opus 5 本身比 Sol 强近 9 个百分点。Terminal-Bench 允许模型搭配不同 Agent 运行,前三名分别用了 mini-SWE-agent、Codex 和 Claude Code。Agent 会决定模型怎么调用工具、执行命令和处理上下文,因此榜单更准确测的是「模型 + Agent」整套系统的能力。
Terminal-Bench 3.0
评论
0/500
登录 后参与讨论
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯