论文研究普通
Aphanta:面向多模态推理的图像编辑中间结果诊断框架
原始标题:Aphanta: Diagnosing Task-Aligned Image-Edited Intermediates for Multimodal Reasoning
内容摘要
Aphanta 提出自动化任务发现与闭环诊断框架,评估"多模态大模型→图像编辑器→多模态大模型"流程中图像编辑器的实际效用。在 20 个候选任务中,效用高度依赖任务类型,增益集中在视觉线索注入、接地与反事实状态实现。在正向任务子集上,整合的 Qwen 流程将平均任务分数从 0.343 提升至 0.445(+10.2 分,相对提升 29.7%)。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-b6979bd0ee71f353ac8e179c