论文研究普通
MoTE:面向多任务视频理解的任务专家混合解码器架构
原始标题:MoTE: Mixture of Task Experts for Multi-Task Video Understanding
内容摘要
论文提出MoTE(Mixture of Task Experts)解码器架构,将大语言模型的前馈网络转换为任务特定专家,同时共享多模态主干网络。实例化模型VideoLLM-MoTE在五个COIN基准上采用显式任务路由,五专家模型每样本激活约2B LLM参数,平均top-1准确率超过近期VideoLLM基线,并优于密集全专家激活与学习式稀疏路由。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-be00ef9c3915358438df29c4