返回列表 发布新帖
查看: 22|回复: 0

[人工智能] 千问大模型发布Qwen-Audio-3.0-ASR-Flash语音识别大模型

发表于 前天 16:04 | 查看全部 |阅读模式

这里或许是互联网从业者的最后一片净土,随客社区期待您的加入!

您需要 登录 才可以下载或查看,没有账号?立即注册

×
本帖最后由 as22 于 2026-7-31 16:15 编辑

7月31日消息,千问大模型宣布正式发布语音识别大模型Qwen-Audio-3.0-ASR-Flash。简单来说,就是让AI更好地听懂专业词汇。

据悉,这次主要在上下文一致性、行业词识别和热词定制化三个维度做了系统性的优化,同时让模型具备语音润色能力,可直接输出结构化文本。

目前,Qwen-Audio-ASR-Flash系列已经在会议纪要整理、实时字幕、教育录播、智能客服等场景里得到广泛验证,曾在全球权威AI评测平台Artificial Analysis上,以1.7%的错字率拿下全球第一。

Qwen-Audio-3.0-ASR——现已通过阿里云百炼平台开放调用,提供三个版本:

Qwen-Audio-3.0-ASR-Flash:语音识别,最长 5 分钟

Qwen-Audio-3.0-ASR-Filetrans:离线文件转写

Qwen-Audio-3.0-ASR-Streaming:实时语音识别

据介绍,Qwen-Audio-3.0-ASR-Flash新增了上下文不“断片”能力,在帮助用户转写当前语音时,它能参考近期已经识别出的内容,顺着同一话题里的关键词和语义往下听,从而减少同音词误判,把术语、中英文混说这些容易出错的地方听得更准。

A32FCC10-77A2-4500-8508-8A98057AE16A.png

该模型还增加了“听得准行业词”的能力,具体来说,研究团队持续从医疗、IT编程、股票、社会名人等领域里挖掘专业词汇,建成了覆盖多行业的高质量词库,加强模型对专业术语和冷门词的识别。在最新的行业词汇内部评测中,新模型对各行业专业词的"听中率"都有明显提升,其中医疗场景更是突破了95.36%。

DECA5AD5-1E59-4340-B291-9EDC876A0DAA.png
同时,Qwen-Audio-3.0-ASR-Flash全新升级即时热词定制能力——在传入热词的情况下,热词“听中率”在所有测试集都达到90%以上,多数场景更是突破99%,不再是“提了这项、掉了那项”。

C249CE77-0210-4350-9D16-82688173FA2B.png

另外还能边识别边润色,在识别环节完成润色,直接输出去掉口头禅、条理清晰的书面文本。口语里的“那个”“嗯”这类口头禅会被直接去掉;说话时的自我纠正,比如“我们下周三评审,不对,是周四”,只保留最后的意思;结结巴巴的重复、零散的口述,也会被整理成简洁、书面的表达。

Qwen-Audio-3.0-ASR-Flash还能听懂多种语言,从中文、日语、韩语,到泰语、越南语、印尼语、马来语等东南亚语言,再到印地语、阿拉伯语,以及英语、法语、德语、西班牙语、葡萄牙语、俄语等欧洲主流语言,都能直接识别,不用针对不同市场频繁换模型。

此外,Qwen-Audio-3.0-ASR-Streaming——面向客服通话、会议实时转写、直播字幕这类对速度要求很高的场景,在保证“几乎不卡顿”地实时出字的同时,把复杂工业场景下的识别准确率也一起拉了上来。

04232810-042D-404f-9BD6-B6DE5BD14B3E.png

体验地址如下:

Qwen-Audio-3.0-ASR-Flash:

https://help.aliyun.com/zh/model ... n-for-fun-asr-flash

Qwen-Audio-3.0-ASR-Flash-Filetrans:

https://help.aliyun.com/zh/model ... ecognition-http-api

Qwen-Audio-3.0-ASR-Flash-Streaming:

https://help.aliyun.com/zh/model ... ltime-websocket-api


您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Copyright © 2001-2026 Suike Tech All Rights Reserved. 随客交流社区 (备案号:津ICP备19010126号) |Processed in 0.116385 second(s), 8 queries , Gzip On, MemCached On.
关灯 在本版发帖返回顶部
快速回复 返回顶部 返回列表