通义百聆再次升级，支持9语种、18种方言

as22 · 发表于 2025-12-15 16:50:15

这里或许是互联网从业者的最后一片净土，随客社区期待您的加入！

您需要登录才可以下载或查看，没有账号？立即注册

×

本帖最后由 as22 于 2025-12-15 16:53 编辑

12月15日消息，今日，通义大模型官方公众号宣布通义百聆语音模型再升级。

本次发布包括：Fun-CosyVoice3模型升级，首包延迟降低50%，中英混字准确率翻倍，支持9语种18方言口音、跨语种克隆与情感控制；Fun-CosyVoice3（0.5B）正式开源，该版本提供zero-shot音色克隆能力，支持本地部署与二次开发。

同时，Fun-ASR模型能力增强，噪声场景准确率 93%、支持歌词与说唱识别、31语种自由混说、方言口音覆盖，并将流式识别模型的首字降低到 160ms；Fun-ASR-Nano（0.8B）开源，Fun-ASR的轻量化版本，推理成本更低，模型开源，支持本地部署与定制化微调。

据悉，本次Fun-CosyVoice3大模型完成多项关键升级：

首包延迟降低50%，支持双向流式合成，真正实现“输入即发声”，适用于语音助手、直播配音、无障碍阅读等实时场景；

中英混说词错误率（WER）相比之前降低56.4%，不论是含专业术语、大小写混排，还是语码转换的句子，都能精准、自然地发音；

在zero-shot TTS评测中，内容一致性与音色相似度全面提升，复杂场景（test-hard）字符错误率（CER）相对降低26%，接近人类录音水平；

9种通用语言、18种中文方言、9种情感控制，并具备跨语种音色复刻能力——用一段普通话录音，即可生成粤语、日语、英语等语音，音色保持高度一致。

此外，还开源了Fun-CosyVoice3-0.5B，该版本提供了 zero-shot 音色克隆能力，只需要你提供一段3秒以上的参考音频，即可复刻其音色并合成新语音，并且支持本地部署和二次开发。

在zero-shot语音合成评测中，Fun-CosyVoice3-0.5B表现优秀，在各个指标上优于主流TTS模型：

作为通义百聆推出的端到端语音识别大模型，Fun-ASR基于数千万小时真实语音数据训练，已在钉钉“AI听记”、视频会议等场景中大规模落地。通义此次对Fun-ASR的核心能力进行了全面升级，重点优化了嘈杂环境鲁棒性、多语言自由混说、中文方言与口音覆盖、歌词识别、定制化能力，并将流式识别模型的首字降低到160ms。

[人工智能] 通义百聆再次升级，支持9语种、18种方言

这里或许是互联网从业者的最后一片净土，随客社区期待您的加入！

快速入口

重要文档

关于我们

联系我们