阿里发布Qwen-Audio-3.0-ASR-Flash语音识别大模型:专业词汇“听中率”突破95%

2026-07-31 18:03:52   |   弘乐   |   7642

7月31日,阿里巴巴正式推出语音识别大模型Qwen-Audio-3.0-ASR-Flash,在上下文一致性、行业词识别和热词定制化三个维度实现系统性升级,让AI在专业场景中的语音识别能力大幅跃升。研究团队持续从医疗、IT编程、股票、社会名人等领域挖掘专业词汇,建成了覆盖多行业的高质量词库。在最新的行业词汇内部评测中,医疗场景专业词“听中率”突破95.36%,IT编程场景达91.87%。此外,工业、畜牧业、文化、股票、社会名人等领域的行业词召回率均取得显著提升。

Qwen-Audio-3.0-ASR-Flash的核心突破聚焦于识别专业词汇——这一直是ASR模型走向行业落地的“最后一公里”。

- 长音频上下文记忆:模型在转写时可参考近期已识别的上下文,延续同一话题的关键词与语义线索,减少同音词误判。数小时会议录音中,同一人名或技术概念不会因跨越多个语音片段就被遗忘。

- 内置多行业词库:传统方案依赖人工维护词表,新模型将行业词识别内化为模型自身能力,无需人工配置即可在真实业务场景中持续进化。

- 分级热词定制:企业专属词汇可即时生效,多数场景召回率突破99%。模型采用声学证据与上下文智能判断方式,避免热词增加引发误触发。

模型还具备语音润色能力,可在识别环节一步完成口语转书面语处理:“那个”“嗯”等填充词被直接去除,说话时的自我修正只保留最终意图,散乱口述自动整理为结构化表达。与传统“ASR+大模型润色”两步方案相比,链路更短、延迟更低、使用成本更低。该模型还内置30余种语言能力,七语种平均语义错误率17.09%,优于Azure、Gemini等同业模型。

Qwen-Audio-ASR系列已在会议纪要整理、实时字幕、教育录播、智能客服等场景中得到广泛验证,离线版本曾在AI评测平台Artificial Analysis以1.7%的错字率拿下全球第一。即日起,Qwen-Audio-3.0-ASR-Flash已在阿里云百炼平台开放调用,提供三个版本:Flash版(最长5分钟语音识别)、Filetrans版(离线文件转写)和Streaming版(实时语音识别)。

特别提醒:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字、图片等内容的真实性、完整性、及时性本站不作任何保证或承诺,请自行核实相关内容。本站不承担此类作品侵权行为的直接责任及连带责任。如若本网有任何内容侵犯您的权益,请及时发送相关信息至bireading@163.com,本站将会在48小时内处理完毕。

阿里发布Qwen-Audio-3.0-ASR-Flash语音识别大模型:专业词汇“听中率”突破95%

2026-07-31 18:03:52 浏览量: 7642 作者: 弘乐

7月31日,阿里巴巴正式推出语音识别大模型Qwen-Audio-3.0-ASR-Flash,在上下文一致性、行业词识别和热词定制化三个维度实现系统性升级,让AI在专业场景中的语音识别能力大幅跃升。研究团队持续从医疗、IT编程、股票、社会名人等领域挖掘专业词汇,建成了覆盖多行业的高质量词库。在最新的行业词汇内部评测中,医疗场景专业词“听中率”突破95.36%,IT编程场景达91.87%。此外,工业、畜牧业、文化、股票、社会名人等领域的行业词召回率均取得显著提升。

Qwen-Audio-3.0-ASR-Flash的核心突破聚焦于识别专业词汇——这一直是ASR模型走向行业落地的“最后一公里”。

- 长音频上下文记忆:模型在转写时可参考近期已识别的上下文,延续同一话题的关键词与语义线索,减少同音词误判。数小时会议录音中,同一人名或技术概念不会因跨越多个语音片段就被遗忘。

- 内置多行业词库:传统方案依赖人工维护词表,新模型将行业词识别内化为模型自身能力,无需人工配置即可在真实业务场景中持续进化。

- 分级热词定制:企业专属词汇可即时生效,多数场景召回率突破99%。模型采用声学证据与上下文智能判断方式,避免热词增加引发误触发。

模型还具备语音润色能力,可在识别环节一步完成口语转书面语处理:“那个”“嗯”等填充词被直接去除,说话时的自我修正只保留最终意图,散乱口述自动整理为结构化表达。与传统“ASR+大模型润色”两步方案相比,链路更短、延迟更低、使用成本更低。该模型还内置30余种语言能力,七语种平均语义错误率17.09%,优于Azure、Gemini等同业模型。

Qwen-Audio-ASR系列已在会议纪要整理、实时字幕、教育录播、智能客服等场景中得到广泛验证,离线版本曾在AI评测平台Artificial Analysis以1.7%的错字率拿下全球第一。即日起,Qwen-Audio-3.0-ASR-Flash已在阿里云百炼平台开放调用,提供三个版本:Flash版(最长5分钟语音识别)、Filetrans版(离线文件转写)和Streaming版(实时语音识别)。

,

Copyright ©2018 铋读网 All Rights Reserved.

京ICP备18051707号

京公网安备 11011302001633号