阿里发布Qwen-Audio-3.0-ASR-Flash语音识别大模型:专业词汇“听中率”突破95%
7月31日,阿里巴巴正式推出语音识别大模型Qwen-Audio-3.0-ASR-Flash,在上下文一致性、行业词识别和热词定制化三个维度实现系统性升级,让AI在专业场景中的语音识别能力大幅跃升。研究团队持续从医疗、IT编程、股票、社会名人等领域挖掘专业词汇,建成了覆盖多行业的高质量词库。在最新的行业词汇内部评测中,医疗场景专业词“听中率”突破95.36%,IT编程场景达91.87%。此外,工业、畜牧业、文化、股票、社会名人等领域的行业词召回率均取得显著提升。
Qwen-Audio-3.0-ASR-Flash的核心突破聚焦于识别专业词汇——这一直是ASR模型走向行业落地的“最后一公里”。
- 长音频上下文记忆:模型在转写时可参考近期已识别的上下文,延续同一话题的关键词与语义线索,减少同音词误判。数小时会议录音中,同一人名或技术概念不会因跨越多个语音片段就被遗忘。
- 内置多行业词库:传统方案依赖人工维护词表,新模型将行业词识别内化为模型自身能力,无需人工配置即可在真实业务场景中持续进化。
- 分级热词定制:企业专属词汇可即时生效,多数场景召回率突破99%。模型采用声学证据与上下文智能判断方式,避免热词增加引发误触发。
模型还具备语音润色能力,可在识别环节一步完成口语转书面语处理:“那个”“嗯”等填充词被直接去除,说话时的自我修正只保留最终意图,散乱口述自动整理为结构化表达。与传统“ASR+大模型润色”两步方案相比,链路更短、延迟更低、使用成本更低。该模型还内置30余种语言能力,七语种平均语义错误率17.09%,优于Azure、Gemini等同业模型。
Qwen-Audio-ASR系列已在会议纪要整理、实时字幕、教育录播、智能客服等场景中得到广泛验证,离线版本曾在AI评测平台Artificial Analysis以1.7%的错字率拿下全球第一。即日起,Qwen-Audio-3.0-ASR-Flash已在阿里云百炼平台开放调用,提供三个版本:Flash版(最长5分钟语音识别)、Filetrans版(离线文件转写)和Streaming版(实时语音识别)。