AI圈报
模型发布 / 更新精选

inclusionAI发布MingTok-Audio:首个统一连续语音分词器

信息来源:蚂蚁 inclusionAI:GitHub 新仓库·
原始标题:inclusionAI/MingTok-Audio

内容摘要

inclusionAI团队推出了MingTok-Audio,这是首个能有效融合语义与声学特征的统一连续语音分词器,适用于语音理解与生成任务。该模型基于纯因果Transformer架构,去除了卷积层以提升效率,并采用VAE进行连续特征建模以实现高质量音频重建。在语音重建性能上,其帧率为50,在SEED-ZH和SEED-EN测试集上的PESQ分别达到4.21和4.04,SIM为0.96,STOI为0.98,显著优于对比模型。在下游ASR任务中,其在多个方言数据集上取得了更低的错误率,例如在Hunan Minnan数据集上WER低至9.80%。
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源蚂蚁 inclusionAI:GitHub 新仓库
站内情报编号intel-9e46eb906869078ac7ee80bc