首测胜过 Claude、成本仅不到 12%!AIP2-1.0 挑战全球第一游戏创作 Agent
BiRun 消息,9 月 2 日,ClawQuest 推出游戏创作 Agent AIP2-1.0。在 Agent Fire Benchmark 中,AIP2-1.0 完成 8 项坦克技能代码优化任务与 2,400 场最终对战,综合评分达到 76.06,高于 Claude Opus 5;模型调用成本为 20.69 美元,仅为 Claude Opus 5 的 11.2%。 游戏行业的下一轮内容增长,可能来自创作者数量的扩张。 生成式 AI 已经降低了图片、视频与代码的制作门槛,也开始让更多人具备过去只有专业团队才掌握的内容生产能力。对游戏行业而言,这意味着玩家不再只能等待开发团队更新内容,也有机会把自己的创意变成真正可以玩的角色、技能与玩法。 ClawQuest 是一个连接 AI、游戏与创作者经济的 Web3 项目。其核心入口 Agent Arena 是一款运行在 Telegram 内的 AI Bot,玩家可以直接调用 Agent,无需自行完成部署。Agent Fire 则是 ClawQuest 旗下首款 AI Agent 子游戏:玩家选择坦克技能,指挥 Agent 优化战斗代码,再由代码驱动坦克自动对战、冲击排行榜。 AIP2-1.0 是 ClawQuest 推出的游戏创作 Agent(Game Creation Agent),能理解玩家想创造什么,并调用相应工具把内容做进游戏。 AIP2 全称 AI Player Two。这个名字说明了它与玩家的分工:玩家作为 Player 1,决定创作方向和最终结果;AIP2-1.0 作为 Player 2,调用工具,协助玩家完成专业实现。 「AI Player Two」:重新定义游戏助手常见的游戏助手,主要解决“怎样玩得更好”:查询攻略、提供提示、复盘对局,或帮助玩家调整画面与硬件设置。它们围绕已经存在的游戏内容提供信息与辅助。 AIP2-1.0 面向的是“玩家想创造什么”。它把代码、工具调用、测试和优化等专业环节交给 Agent,让玩家把精力留给想法、判断与取舍。即使不具备开发者级别的代码能力,玩家也可以参与游戏内容创作。 这代表一种新的分工:开发团队构建游戏世界与基础规则,玩家与 AI 则可以在规则之内持续创造新的内容。游戏助手由此从“帮玩家使用内容”,走向“帮玩家创造内容”。 一款 AI Agent Game,如何测试游戏创作能力? Agent Fire 是一款由代码驱动坦克自动战斗的竞技游戏。玩家先为坦克选择技能,再指挥自己连接的 Agent 优化战斗代码;代码完成测试与部署后,坦克会按照代码自动作战,战绩与段位直接进入排行榜。 ClawQuest 将这套玩法整理为 Agent Fire Benchmark,用实战检验 Agent 能否把玩家的选择转化为有效的游戏内容。参测阵容包括 AIP2-1.0、GPT-5.6 Sol、Claude Opus 5、Kimi K3 和 GLM-5.2。 测试覆盖 8 个不同的坦克技能任务。参测 Agent 需要优化代码、接受隐藏测试、根据反馈继续修正并完成部署。每项技能随后进行 300 场最终对战;完整完成 8 项任务的 AIP2-1.0、GPT-5.6 Sol 与 Claude Opus 5,各自接受了 2,400 场实战检验。 只看胜负,还不足以判断一段游戏代码是否真正可用。代码能否正确运行、能否稳定完成测试与部署、进入不同对局后能否持续生效,以及整个过程消耗多少资源,都会影响实际体验。因此,Agent Fire Benchmark 的综合评分满分为 100 分:代码正确性占。
评论
0/500
登录 后参与讨论
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯