千问查漏洞3轮召回率追平Opus 5,成本只有一半

BiRun 讯,安全公司 Aikido 用代码审计 Agent 测试了 7 款模型,包括 Qwen3.8-Max、Claude Opus 5、Kimi K3 Max、DeepSeek V4 Flash,以及 GPT-5.6 Sol、Luna 和 Terra。测试包含 32 个近期公开漏洞,每款模型运行 3 次。

Qwen3.8-Max 三轮合计找到 26 个漏洞,召回率达到 81.3%,与 Opus 5 并列第一。它的 F1 综合分(兼顾漏报和误报)为 83.2%,略低于 Opus 5、Kimi K3 Max 和 GPT-5.6 Sol。

千问的问题是单次发挥不稳定。26 个漏洞中,只有 10 个连续三轮都能找到,Opus 5 和 Sol 都有 19 个。不过,千问总成本约 821 美元,只有 Opus 5 和 Sol 的一半,但仍是 DeepSeek V4 Flash 的 5 倍。

pilvar
利空 SOLSOL 查看原文
你怎么看这条消息?来投第一票

评论

0/500
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯