返回列表 发布新帖
查看: 10|回复: 0

[人工智能] 通义百聆再次升级,支持9语种、18种方言

发表于 昨天 16:50 | 查看全部 |阅读模式

这里或许是互联网从业者的最后一片净土,随客社区期待您的加入!

您需要 登录 才可以下载或查看,没有账号?立即注册

×
本帖最后由 as22 于 2025-12-15 16:53 编辑

12月15日消息,今日,通义大模型官方公众号宣布通义百聆语音模型再升级。

本次发布包括:
Fun-CosyVoice3模型升级,首包延迟降低50%,中英混字准确率翻倍,支持9语种18方言口音、跨语种克隆与情感控制;Fun-CosyVoice3(0.5B)正式开源,该版本提供zero-shot音色克隆能力,支持本地部署与二次开发。

同时,Fun-ASR模型能力增强,噪声场景准确率 93%、支持歌词与说唱识别、31语种自由混说、方言口音覆盖,并将流式识别模型的首字降低到 160ms;Fun-ASR-Nano(0.8B)开源,Fun-ASR的轻量化版本,推理成本更低,模型开源,支持本地部署与定制化微调。

据悉,本次Fun-CosyVoice3大模型完成多项关键升级:

首包延迟降低50%,支持双向流式合成,真正实现“输入即发声”,适用于语音助手、直播配音、无障碍阅读等实时场景;

中英混说词错误率(WER)相比之前降低56.4%,不论是含专业术语、大小写混排,还是语码转换的句子,都能精准、自然地发音;

在zero-shot TTS评测中,内容一致性与音色相似度全面提升,复杂场景(test-hard)字符错误率(CER)相对降低26%,接近人类录音水平;

9种通用语言、18种中文方言、9种情感控制,并具备跨语种音色复刻能力——用一段普通话录音,即可生成粤语、日语、英语等语音,音色保持高度一致。

此外,还开源了Fun-CosyVoice3-0.5B,该版本提供了 zero-shot 音色克隆能力,只需要你提供一段3秒以上的参考音频,即可复刻其音色并合成新语音,并且支持本地部署和二次开发。


在zero-shot语音合成评测中,Fun-CosyVoice3-0.5B表现优秀,在各个指标上优于主流TTS模型:

A9304B49-880E-4b95-9A85-A3DBE3CBDC53.png

作为通义百聆推出的端到端语音识别大模型,Fun-ASR基于数千万小时真实语音数据训练,已在钉钉“AI听记”、视频会议等场景中大规模落地。通义此次对Fun-ASR的核心能力进行了全面升级,重点优化了嘈杂环境鲁棒性、多语言自由混说、中文方言与口音覆盖、歌词识别、定制化能力,并将流式识别模型的首字降低到160ms。

D338D772-E01A-41f1-91AA-153DAAC59837.png

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Copyright © 2001-2025 Suike Tech All Rights Reserved. 随客交流社区 (备案号:津ICP备19010126号) |Processed in 0.104868 second(s), 8 queries , Gzip On, MemCached On.
关灯 在本版发帖返回顶部
快速回复 返回顶部 返回列表