OpenRouter实测AI搜索:多搜几轮比换搜索引擎更重要

BiRun 讯,OpenRouter 上线 Web Search Benchmarks,专门测试 AI 联网搜索到底该怎么配。首批覆盖 Exa、Parallel、Perplexity 和模型自带搜索,并搭配 GPT-5.6 Sol、Claude Opus 5、DeepSeek V4 Flash 等模型,在 4 组搜索评测上比较准确率、成本和速度。

结果最明显的一点是:搜索轮数比换搜索引擎更重要。在 BrowseComp 这类难题上,把搜索上限从 1 轮提高到 25 轮,得分大约可以翻倍,单题成本则增加约 2.5 到 7 倍。比如 Claude Opus 5 搭配 Perplexity,从 1 轮的 35.8% 提升到 25 轮的 89.0%。

模型本身也比搜索引擎更重要。保持其他条件不变,换模型平均能拉开约 15 分,换 Exa、Parallel、Perplexity 等搜索引擎平均影响约 10 分。模型厂商自己的搜索也不一定最好,具体要看任务。

但搜得越多不一定越划算。BrowseComp 中,答对时模型平均搜索 10.3 次,答错时反而会搜 19.7 次。对于本来就很难找到答案的任务,放开搜索次数,很可能只是让 Agent 更贵地失败。

OpenRouter
你怎么看这条消息?来投第一票

评论

0/500
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯