DeepSeek视觉模型多模态Agent能力逼近Opus 4.8!4项打成2:2
BiRun 讯,DeepSeek 公布 V4-Flash-Vision-Exp 的首批 Agent 跑分。在 4 项多模态 Agent 评测中,它和 Opus 4.8 打成 2 胜 2 负:Agents' Last Exam 为 27.3 对 25.7,ZeroBench 为 35.0 对 34.0;ApexBench 为 36.5 对 39.4,Chartography 为 64.3 对 65.0。
相比纯文本版 V4-Flash-0731,视觉版在 ApexBench 从 26.2 升到 36.5,Agents' Last Exam 从 25.2 升到 27.3。不过这两个评测本身包含图片,官方注明 V4-Flash 会直接忽略其中的多模态内容,因此这里主要体现的是补上视觉输入后的能力,而不是纯文本推理突然变强。
加上视觉后,文本 Agent 能力也没有明显缩水。7 项文本评测里,Vision Exp 有 6 项高于 V4-Flash-0731。比如 DeepSWE 从 54.4 升到 59.3,甚至超过 Opus 4.8 的 58.0;Toolathlon 为 75.9,也几乎追平 Opus 4.8 的 76.2。
需要注意,这组结果来自 DeepSeek 官方自测,不是第三方独立榜单。DeepSeek 系列在公开 Code Agent 文本任务中使用 DeepSeek Harness 极简模式,推理档位设为 max。
(据 官方公告 报道)
相比纯文本版 V4-Flash-0731,视觉版在 ApexBench 从 26.2 升到 36.5,Agents' Last Exam 从 25.2 升到 27.3。不过这两个评测本身包含图片,官方注明 V4-Flash 会直接忽略其中的多模态内容,因此这里主要体现的是补上视觉输入后的能力,而不是纯文本推理突然变强。
加上视觉后,文本 Agent 能力也没有明显缩水。7 项文本评测里,Vision Exp 有 6 项高于 V4-Flash-0731。比如 DeepSWE 从 54.4 升到 59.3,甚至超过 Opus 4.8 的 58.0;Toolathlon 为 75.9,也几乎追平 Opus 4.8 的 76.2。
需要注意,这组结果来自 DeepSeek 官方自测,不是第三方独立榜单。DeepSeek 系列在公开 Code Agent 文本任务中使用 DeepSeek Harness 极简模式,推理档位设为 max。
(据 官方公告 报道)
评论
0/500
登录 后参与讨论
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯