ElevenLabs推出v4与v4 Turbo语音模型:10秒素材即可克隆声音
9月29日,ElevenLabs于当地时间周一正式推出两款全新语音模型,分别为v4与v4 Turbo。新版模型强化了情绪表达控制能力,降低了语音智能体的响应延迟,同时支持90余种语言。新系列采用全新架构,实现了更精细的语音控制以及更快的声音克隆,官方表示用户仅需10秒音频素材即可完成克隆。
在内容创作方面,朗读大段文本时新版模型能更好地维持说话人音色,并记住前后文本语境以调整语气。此前的v3引入了内联标签设定语音情绪,到了v4标签功能进一步扩充,用户可叠加多个标签并按先后顺序执行。旧版支持70种语言,优化后提升至90种,其中日语、巴西葡萄牙语、普通话与粤语的合成质量提升最为显著。
过去一年ElevenLabs的企业语音通话业务扩张迅速,目前超过55%的收入来自大型企业,新模型非常适配语音智能体场景,更低延迟带来更流畅对话,且当后端大模型刚开始输出时v4就能同步生成语音。今年早些时候,ElevenLabs从红杉资本获得5亿美元融资,投后估值达110亿美元,目前已有传闻称正筹备新一轮融资,目标估值或达220亿美元。其年化营收运行速率已从年初约3.3亿美元攀升至6亿美元以上,员工总数突破800人,联合创始人兼CEO表示计划未来几年内完成IPO。