OpenAI推出两款转录模型:GPT-Transcribe与GPT-Live-Transcribe
7月29日,OpenAI通过其开发者官方账号宣布,正式推出两款全新的转录模型——GPT-Transcribe与GPT-Live-Transcribe,并已通过API向开发者开放调用。这两款模型在上下文理解和多语言、多口音的真实世界音频转录能力上,相比此前的Whisper模型实现了显著提升。
此次推出的两款模型有着清晰的产品定位,分别面向不同的应用场景:
- GPT-Live-Transcribe:专为低延迟实时转录而设计。它适用于需要即听即转的场景,如实时会议字幕、现场演讲转录、语音助手交互等,力求将延迟降到最低。其调用费用为每分钟0.017美元(约合0.12元人民币)。
- GPT-Transcribe:主要针对已完成音频文件和批量任务的异步转录进行优化。它更适合对成本敏感、且对实时性要求不高的场景,如录音归档、访谈录音整理、播客内容生成等。其定价更低,为每分钟0.0045美元(约合0.03元人民币)。
OpenAI官方表示,这两款新模型相比前代,最大的进步在于能够“更好地理解上下文”。这使得它们在处理带有口音、专业术语、短句以及背景噪音的音频时,能够提供更准确的转录结果。
在多项基准测试中,新模型的性能提升表现直观。例如,在专注评估上下文感知能力的Context Aware ASR基准测试中,GPT-Transcribe在加入上下文信息后,语义准确率从41.6%提升至45.2%。在与自家Whisper模型的对比中,优势更为明显:
- Common Voice基准(22种语言):GPT-Transcribe的单词错误率为19.27%,而Whisper (whisper-1) 的错误率高达40.37%。
- 真实世界音频录制基准(9种语言):GPT-Transcribe的错误率进一步降至8.98%,而Whisper为15.21%。
这组数据意味着GPT-Transcribe的转录错误率不到Whisper的一半,尤其在复杂的真实场景下表现出色。目前,这两款新模型已可通过OpenAI API进行调用。