Meta发布实时音频感知模型Muse Voice Transcribe:每分钟识别单价约0.18美元
9月2日,Meta公司昨日(9月1日)推出Muse Voice Transcribe,这是其首个实时音频感知AI模型。该模型在同一流程中整合了流式自动语音识别、说话人分离与端点检测,用户说话时系统可同步输出文字,无需等待完整录音结束后再单独处理。开发者可通过Meta Model API调用该能力,定价为每1000分钟音频3美元(约合每小时0.18美元,即1.2元人民币)。
在技术能力上,Muse Voice Transcribe可在包含20余名说话者的录音中分离不同发言者,并能识别说话是否结束,自动确定一段输入的边界。模型训练覆盖70余种语言,其中25种语言在发布时完成验证,支持长度超过1小时的音频及句内或句间的自然语言切换。开发者还可通过语言、关键词和上下文偏置,提高特定场景下的识别效果。
为兼顾实时响应与识别准确度,Meta引入了自适应延迟(adaptive delay)动态决策机制。系统会针对每个词判断需要额外接收多少音频后再输出识别结果——对于较容易识别的语音,系统可更快提交转写结果;对于发音不清、术语较多或语境复杂的词语,系统会调用更多前后文音频信息,以平衡速度与准确度。
Meta官方称,截至2026年9月1日,Muse Voice Transcribe在Artificial Analysis流式语音转文本排行榜中位列第1。这一表现意味着Meta在实时音频感知领域进入了行业前列。随着实时语音交互应用场景的日益广泛,这一模型的推出为开发者提供了更多选择。