大模型也分满血版和缩水版:换家云厂商,能力可能差一倍

BiRun 讯,模型评测机构 Artificial Analysis 推出 API 准确率榜单,测试同一个开源模型,换到不同服务商后还能保留多少能力。首批测试 GLM-5.2、gpt-oss-120b 和 DeepSeek V4 Pro,共覆盖 44 个 API 端点。

服务商包括 AWS、微软 Azure、Google Vertex、Cloudflare,也有 Fireworks、DeepInfra、CoreWeave、SiliconFlow 等 AI 推理平台。Artificial Analysis 自行部署官方模型,把成绩记为 100%,再用相同题目测试各家 API。

结果显示,GLM-5.2 最差端点只有 52%,几乎砍半。gpt-oss-120b 得分在 70% 至 101% 之间。DeepSeek V4 Pro 最稳定,9 家服务商都在 97% 至 107%,官方 API 得分最高。

差距主要来自量化、输出长度、推理配置和工具调用处理。同一个模型名字,实际能力可能完全不同,选 API 不能只看价格和速度。

Artificial Analysis
你怎么看这条消息?来投第一票

评论

0/500
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯