Meta发布实时音频感知模型Muse Voice Transcribe:每分钟识别单价约0.18美元

2026-09-02 18:20:33   |   唐微   |   4014

9月2日,Meta公司昨日(9月1日)推出Muse Voice Transcribe,这是其首个实时音频感知AI模型。该模型在同一流程中整合了流式自动语音识别、说话人分离与端点检测,用户说话时系统可同步输出文字,无需等待完整录音结束后再单独处理。开发者可通过Meta Model API调用该能力,定价为每1000分钟音频3美元(约合每小时0.18美元,即1.2元人民币)。

在技术能力上,Muse Voice Transcribe可在包含20余名说话者的录音中分离不同发言者,并能识别说话是否结束,自动确定一段输入的边界。模型训练覆盖70余种语言,其中25种语言在发布时完成验证,支持长度超过1小时的音频及句内或句间的自然语言切换。开发者还可通过语言、关键词和上下文偏置,提高特定场景下的识别效果。

为兼顾实时响应与识别准确度,Meta引入了自适应延迟(adaptive delay)动态决策机制。系统会针对每个词判断需要额外接收多少音频后再输出识别结果——对于较容易识别的语音,系统可更快提交转写结果;对于发音不清、术语较多或语境复杂的词语,系统会调用更多前后文音频信息,以平衡速度与准确度。

Meta官方称,截至2026年9月1日,Muse Voice Transcribe在Artificial Analysis流式语音转文本排行榜中位列第1。这一表现意味着Meta在实时音频感知领域进入了行业前列。随着实时语音交互应用场景的日益广泛,这一模型的推出为开发者提供了更多选择。

特别提醒:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字、图片等内容的真实性、完整性、及时性本站不作任何保证或承诺,请自行核实相关内容。本站不承担此类作品侵权行为的直接责任及连带责任。如若本网有任何内容侵犯您的权益,请及时发送相关信息至bireading@163.com,本站将会在48小时内处理完毕。

Meta发布实时音频感知模型Muse Voice Transcribe:每分钟识别单价约0.18美元

2026-09-02 18:20:33 浏览量: 4014 作者: 唐微

9月2日,Meta公司昨日(9月1日)推出Muse Voice Transcribe,这是其首个实时音频感知AI模型。该模型在同一流程中整合了流式自动语音识别、说话人分离与端点检测,用户说话时系统可同步输出文字,无需等待完整录音结束后再单独处理。开发者可通过Meta Model API调用该能力,定价为每1000分钟音频3美元(约合每小时0.18美元,即1.2元人民币)。

在技术能力上,Muse Voice Transcribe可在包含20余名说话者的录音中分离不同发言者,并能识别说话是否结束,自动确定一段输入的边界。模型训练覆盖70余种语言,其中25种语言在发布时完成验证,支持长度超过1小时的音频及句内或句间的自然语言切换。开发者还可通过语言、关键词和上下文偏置,提高特定场景下的识别效果。

为兼顾实时响应与识别准确度,Meta引入了自适应延迟(adaptive delay)动态决策机制。系统会针对每个词判断需要额外接收多少音频后再输出识别结果——对于较容易识别的语音,系统可更快提交转写结果;对于发音不清、术语较多或语境复杂的词语,系统会调用更多前后文音频信息,以平衡速度与准确度。

Meta官方称,截至2026年9月1日,Muse Voice Transcribe在Artificial Analysis流式语音转文本排行榜中位列第1。这一表现意味着Meta在实时音频感知领域进入了行业前列。随着实时语音交互应用场景的日益广泛,这一模型的推出为开发者提供了更多选择。

,

Copyright ©2018 铋读网 All Rights Reserved.

京ICP备18051707号

京公网安备 11011302001633号