Meta推出GAMUT基准测试AI事实完整性
BiRun 消息,Meta推出GAMUT基准测试,通过1813个多模态问题评估AI模型的事实完整性表现。在测试中,得分最高的Gemini 3.1 Pro准确率仅为58.7%,表明当前主流AI模型在事实完备性方面仍有较大提升空间。该基准旨在衡量模型回答的全面性和准确性,推动行业对AI生成内容可靠性的研究与改进。
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯