AI圈报
模型发布 / 更新精选

LongCat-Video-Avatar-1.5:升级版音频驱动数字人视频生成框架

信息来源:美团 LongCat:HuggingFace 新模型·
原始标题:meituan-longcat/LongCat-Video-Avatar-1.5

内容摘要

美团LongCat团队发布了LongCat-Video-Avatar-1.5,一个专注于音频驱动数字人视频生成的开源框架。其核心升级在于采用Whisper-Large音频编码器,显著优化了唇部动态的流畅度与自然度。该版本实现了精准的唇形同步、全身时序稳定性以及长视频中的身份一致性,并能泛化应用于动漫、动物及多人交互等复杂场景。通过基于DMD2的步蒸馏技术,模型仅需8步即可高效推理。团队还构建了一个涵盖多场景、多语言的人工评估基准,通过大规模主观评分与专家分析,验证了其在多项关键维度上的优异性能。
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源美团 LongCat:HuggingFace 新模型
站内情报编号intel-bbde39df553ea51244abe344