阶跃星辰发布StepAudio3系列模型,多款登顶Artificial Analysis全球第一

2026-09-15 18:10:06   |   唐微   |   5378

9月15日,阶跃正式发布StepAudio3系列模型,包括StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen和StepAudio3Music,其中多款模型在Artificial Analysis榜单中位列全球第一。目前五款模型均已上线阶跃星辰开放平台。

官方称,StepAudio 3系列分别面向真人级语音生成、完整音频内容生成、实时语音交互、复杂场景语音理解和音乐创作等核心场景。

StepAudio 3 Realtime:支持原生全双工实时对话,在Artificial Analysis Conversational Dynamics榜单中以98.9%的综合得分排名全球第一,并在Speech Reasoning榜单中以99.7%的语音推理准确率位列全球第一。模型可同时理解语义、语气、情绪、副语言和环境声音,支持推理与语音生成并行,Tool Call和长任务可异步执行而不阻塞当前语音会话。

StepAudio 3 ASR:将高精度语音识别与大语言模型的上下文理解、知识和推理能力结合,支持中文、英文、方言、中英混说、长音频及专业领域识别,也能处理低声、快语速、含糊连读、歌声和背景音乐等复杂输入。在Artificial Analysis非流式语音识别准确性榜单中,WER仅为1.7%,并列全球第一。

StepAudio 3 TTS:面向实时交互场景的真人级语音生成模型,在音色基底、语调层次、节奏律动和气口停顿等方面贴合人类自然口语模式,能还原笑声、迟疑、结巴、重复、改口等副语言表现,基于流式生成架构实现生成与播放同步。

StepAudio 3 Gen:统一生成人声、音效、环境音和背景音乐,支持对多个角色的音色、说话方式、语气、情绪、方言口音及副语言特征进行精细控制,并可指定对白、音效、环境声和背景音乐的出现时间与顺序,适用于影视、动画、游戏、广播剧、有声书和短视频创作。

StepAudio 3 Music:支持从零生成及基于ABC记谱法控制的多轮交互创作,支持歌曲创作、清唱配乐、歌曲翻唱等功能,用户可通过自然语言控制曲风、人声、旋律、节奏、乐器、情绪、段落和制作质感,并对主歌、副歌、桥段、间奏等歌曲结构及跨段落旋律发展进行建模。

特别提醒:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字、图片等内容的真实性、完整性、及时性本站不作任何保证或承诺,请自行核实相关内容。本站不承担此类作品侵权行为的直接责任及连带责任。如若本网有任何内容侵犯您的权益,请及时发送相关信息至bireading@163.com,本站将会在48小时内处理完毕。

阶跃星辰发布StepAudio3系列模型,多款登顶Artificial Analysis全球第一

2026-09-15 18:10:06 浏览量: 5378 作者: 唐微

9月15日,阶跃正式发布StepAudio3系列模型,包括StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen和StepAudio3Music,其中多款模型在Artificial Analysis榜单中位列全球第一。目前五款模型均已上线阶跃星辰开放平台。

官方称,StepAudio 3系列分别面向真人级语音生成、完整音频内容生成、实时语音交互、复杂场景语音理解和音乐创作等核心场景。

StepAudio 3 Realtime:支持原生全双工实时对话,在Artificial Analysis Conversational Dynamics榜单中以98.9%的综合得分排名全球第一,并在Speech Reasoning榜单中以99.7%的语音推理准确率位列全球第一。模型可同时理解语义、语气、情绪、副语言和环境声音,支持推理与语音生成并行,Tool Call和长任务可异步执行而不阻塞当前语音会话。

StepAudio 3 ASR:将高精度语音识别与大语言模型的上下文理解、知识和推理能力结合,支持中文、英文、方言、中英混说、长音频及专业领域识别,也能处理低声、快语速、含糊连读、歌声和背景音乐等复杂输入。在Artificial Analysis非流式语音识别准确性榜单中,WER仅为1.7%,并列全球第一。

StepAudio 3 TTS:面向实时交互场景的真人级语音生成模型,在音色基底、语调层次、节奏律动和气口停顿等方面贴合人类自然口语模式,能还原笑声、迟疑、结巴、重复、改口等副语言表现,基于流式生成架构实现生成与播放同步。

StepAudio 3 Gen:统一生成人声、音效、环境音和背景音乐,支持对多个角色的音色、说话方式、语气、情绪、方言口音及副语言特征进行精细控制,并可指定对白、音效、环境声和背景音乐的出现时间与顺序,适用于影视、动画、游戏、广播剧、有声书和短视频创作。

StepAudio 3 Music:支持从零生成及基于ABC记谱法控制的多轮交互创作,支持歌曲创作、清唱配乐、歌曲翻唱等功能,用户可通过自然语言控制曲风、人声、旋律、节奏、乐器、情绪、段落和制作质感,并对主歌、副歌、桥段、间奏等歌曲结构及跨段落旋律发展进行建模。

,

Copyright ©2018 铋读网 All Rights Reserved.

京ICP备18051707号

京公网安备 11011302001633号