AI当分析师还不够靠谱:每道题做5遍,Claude Opus 5只有54%的题能全对

BiRun 讯,Artificial Analysis 推出一个新的 AI 分析能力测试 AA-AnalystAgent。它让模型处理真实的表格和文档,完成数据统计、趋势分析、财务建模等工作。测试共有 80 道题,每道题让模型独立做 5 遍,只有 5 次全部答对才算通过。

结果第一名是 Claude Opus 5,但也只有 54% 的题能连续 5 次全部答对。GPT-5.5 排第二,通过率为 50%;Claude Fable 5 为 49%。开放权重模型里表现最好的是 Kimi K3,为 39%。

如果只看每一次作答的平均正确率,GPT-5.5 其实最高,达到 66%。但要求同一道题连续做对 5 次后,它的通过率只剩 50%。Claude Opus 5 单次正确率略低,却更稳定,所以最终排在第一。

AI 最常见的问题还不是不会算,而是一开始就把题理解错了。Artificial Analysis 分析了 1567 次失败记录,其中 57% 都出现了这种情况:模型过早认定一个错误解释,随后一直沿着这个方向做下去。

Artificial Analysis
利多 查看原文
你怎么看这条消息?来投第一票

评论

0/500
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯