论文研究普通
Video-IFBench:评估多模态大模型在视频理解场景中的指令跟随能力
原始标题:Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios
内容摘要
研究团队推出 Video-IFBench,一个专门评估多模态大模型在视频理解中指令跟随能力的基准。该基准包含四种指令模板、32 种任务类型和 39 类约束,并通过半自动流程构建了 1.5K 样本。对 20 多个近期 MLLM 的大规模评测显示,视频指令跟随对现有模型仍具挑战性,尤其在多约束、语义约束和复杂条件结构场景下。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-71b7aa30a4f9601c012e1d7e