阿里Qwen-Audio-3.0语音模型上线:ASR、TTS、实时交互全球评测“大满贯”
8月18日,据报道,阿里云宣布,自研Qwen-Audio-3.0系列语音模型已正式上线千问AI平台和阿里云百炼平台,开发者可通过API调用或订阅Token Plan使用。
该系列包含三款产品:语音识别模型Qwen-Audio-3.0-ASR、语音合成模型Qwen-Audio-3.0-TTS,以及实时语音交互对话模型Qwen-Audio-3.0-Realtime。根据全球权威AI评测平台Artificial Analysis今年7月的语音排行榜,该系列一举斩获ASR、RealTime和TTS三大赛道全球第一,实现“大满贯”。
在技术表现上:
- ASR模型在包含中文方言、多语言混合及专业领域术语的测试集上均保持高准确率
- TTS模型支持多语种、多方言,并支持控制情绪、语气与节奏
- Realtime模型支持端到端语音理解与对话,可边听边说、随时打断追问,并支持工具调用
目前,该系列模型已在千问App、千问办公、Qoder等产品中落地应用。分析人士认为,Qwen-Audio-3.0在ASR、TTS与实时交互三大赛道同时登顶,有望推动语音交互从“能听会说”向“实时深度理解”演进,进一步提升AI应用的听觉智能水平。