AI开始自动改Agent Harness了:Opus 5四项拿三项第一
BiRun 讯,Scale AI 推出 HarnessOpt-Bench,专门测试 AI 能不能自己修改 Agent 的 harness,把另一个 Agent 调得更强。
Harness 就是包在模型外面的那套程序,包括 prompt、工具、记忆和工作流程。测试时,AI 会拿到一个故意没有充分优化的 harness,根据跑分和失败案例不断改代码,但里面的模型本身不变。
改完之后,Scale 再拿一批它从没见过的测试题考试,看改完后的 Agent 到底有没有真的变强。这样可以避免 AI 只针对已知题目刷分。
Scale 用 Claude Opus 5、GPT-5.6 Sol、Kimi K3 等 5 个模型,在 4 类任务上跑了 111 次。Opus 5 表现最好,4 项拿下 3 项第一。
整体来看,负责改 harness 的模型是谁,比它用 Claude Code、Codex 还是 OpenCode 来改代码更重要。
不过这还不是真正的「AI 自我改进」。因为这次是一个 AI 去改另一个 Agent 的 harness,而且起始 harness 本来就故意留了不少优化空间。
Scale AI
Harness 就是包在模型外面的那套程序,包括 prompt、工具、记忆和工作流程。测试时,AI 会拿到一个故意没有充分优化的 harness,根据跑分和失败案例不断改代码,但里面的模型本身不变。
改完之后,Scale 再拿一批它从没见过的测试题考试,看改完后的 Agent 到底有没有真的变强。这样可以避免 AI 只针对已知题目刷分。
Scale 用 Claude Opus 5、GPT-5.6 Sol、Kimi K3 等 5 个模型,在 4 类任务上跑了 111 次。Opus 5 表现最好,4 项拿下 3 项第一。
整体来看,负责改 harness 的模型是谁,比它用 Claude Code、Codex 还是 OpenCode 来改代码更重要。
不过这还不是真正的「AI 自我改进」。因为这次是一个 AI 去改另一个 Agent 的 harness,而且起始 harness 本来就故意留了不少优化空间。
Scale AI
评论
0/500
登录 后参与讨论
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯