模型答错,可能是压根没看清:Kimi给AI做了套视力表
BiRun 讯,月之暗面发布 PerceptionBench,专门检查多模态模型到底有没有看清图片。
现有评测经常把视觉、知识和推理混在一起。模型答错后,很难判断它是看错了,还是想错了。
PerceptionBench 先收集前沿模型在 42 个基准中的失败案例,再从错误中反推出计数、定位、文字识别、空间判断等 10 项基础视觉能力。
团队据此制作了 3000 道题。每道题只测一项能力,看图就能回答,不需要推理,也不需要外部知识。
项目代码和数据集已经开放。
PerceptionBench
现有评测经常把视觉、知识和推理混在一起。模型答错后,很难判断它是看错了,还是想错了。
PerceptionBench 先收集前沿模型在 42 个基准中的失败案例,再从错误中反推出计数、定位、文字识别、空间判断等 10 项基础视觉能力。
团队据此制作了 3000 道题。每道题只测一项能力,看图就能回答,不需要推理,也不需要外部知识。
项目代码和数据集已经开放。
PerceptionBench
评论
0/500
登录 后参与讨论
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯