腾讯自建Agent基准,结果自家CodeBuddy没打过Claude Code

BiRun 讯,腾讯做了一套 Agent 基准 WorkBuddy Bench,顺手让自家 CodeBuddy Code 和 Claude Code 正面对打。

260 道真实工作题分成代码、Web、办公、安全四类,7 个模型都用两套 Harness 各跑一遍。Harness 就是模型外面的 Agent 执行层,负责上下文、工具调用和任务执行。

28 组同模型对比,Claude Code 赢了 17 组,CodeBuddy 只赢 11 组。代码更是 7:0,7 个模型换成 Claude Code 后全部涨分。

CodeBuddy 也没有全面挨打。Web 和办公都是 4:3 小胜,安全则被 Claude Code 4:3 拿下。

同一个模型只换 Harness,成绩就能差十几分。所以看 Agent 强不强,已经不能只看底层模型。

但腾讯这份榜单也有明显不足。260 道题拆成四类后,每类只有 50 到 80 题。社区有人质疑,这么少的题能不能撑起稳定的模型排名。

另外,GitHub 上也有人嫌只测了两套 Harness,连 Codex 都没有。

腾讯
你怎么看这条消息?来投第一票

评论

0/500
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯