AI圈报
模型发布 / 更新精选

Qwen3.5-LiveTranslate:从声音到视觉,从词语到准确

信息来源:Qwen:Blog Retrieval(API)·
原始标题:Qwen3.5-LiveTranslate: From Sound to Sight, From Word to Right

内容摘要

Qwen3.5-LiveTranslate-Flash 是 Qwen 家族最新的同声传译模型,基于 Qwen3.5-Omni 架构,支持实时多模态翻译(音频、视频及视觉上下文)。语言覆盖大幅扩展:输入音频与输出文本从18种增至60种,输出音频从10种增至29种。采用 Readable Unit 技术,平均端到端每 token 延迟降至2.8秒,相比前代首 token 延迟降低3.45秒、每 token 延迟降低1.88秒。支持一句话启动的实时语音克隆和可动态配置的热词增强。在 FLEURS 和 CoVoST2 基准上翻译准确率超越主流商用大语音模型。
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Qwen:Blog Retrieval(API)
站内情报编号intel-85a682411c8a9990558de44d