论文研究普通
StreamPI:为视觉-语言-动作模型引入流式多模态时序建模
原始标题:StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models
内容摘要
StreamPI 提出一种流式多模态时序建模框架,在不增加任何参数的前提下,为 pi0.5 等单帧 VLA 模型赋予时序推理能力。其核心设计包括指令锚定时序建模与随机间隔流式训练策略,支持单帧与多帧推理,并提升异步部署的鲁棒性。在真实机器人任务与 LIBERO 仿真基准上,StreamPI 均优于 pi0.5。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-e66dc73a1617c4d01d6a030f