AI圈报
论文研究精选

ActiveVision 基准测试揭示多模态大模型缺乏主动视觉观察能力

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:An Exam for Active Observers

内容摘要

最新基准测试 ActiveVision 通过 17 项任务评估多模态大语言模型(MLLM)的主动观察能力。得分最高的 GPT-5.5(最高推理层级)仅解决 10.6% 的任务,在 11 项任务上得零分;Claude Fable 5 仅解决 3.5%,而三名人类参与者平均得分 96.1%。即使模型自行编写并运行视觉代码,差距依然显著,表明当前 MLLM 缺乏鲁棒的主动视觉观察能力。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-3c7e0f9a0c259b705502a81e