谷歌推出Gemini 3.8 Flash/Flash-Lite语音模型:每行台词都能精细操控

2026-09-24 15:05:22   |   嫣然   |   6826

9月24日,谷歌今天宣布,Gemini家族新增两款文本转语音模型,把语音生成从过去的静态预设变成了一个动态创意工作室,帮创作者、开发者和企业做出更有表现力的音频,也为Gemini Notebook和Google Vids等产品改进了体验。两款新模型分别是Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS,定位各有侧重:前者面向深度的创意方向和角色设计,能用自然语言提示从头造出新语音,在游戏、沉浸式有声读物和互动媒体里赋予角色生命力,还能精细控制表演提示、节奏和方言转换;后者面向大容量、高性价比的规模场景,针对大批量配音和富有表现力的语音代理做了优化,对音调、节奏和表现力的细微差别都能精细拿捏。

在声音来源上,用户可以从原先30种原始语音扩展到无限语音库。生成式语音设计允许用自然语言提示,在100多种语言和方言里自定义角色、口音和语音特征,从头创建定制声音;扩展语音库则提供2000多种现成语音,覆盖墨西哥西班牙语、魁北克法语、苏格兰英语等区域变体;语音复制只要30秒音频样本就能重现一致的声音特征,并内置同意验证、SynthID水印和C2PA凭据来保护开发者和声音人才;自定义语音还能保存管理,尽量减小漂移。选好声音后,两款模型都能精确控制每一行台词的演绎方式,你可以自己写舞台指导,也可以让Gemini用自然脚本提示来引导交付,无论是平静的客服还是低声的悬疑场景都不在话下。长篇生成能在数小时连续音频里保持高质量和稳定音色,原生双声音场景编排则能从一个脚本里无缝指导多轮对话,再加上笑声、叹息这类非语言提示,凑出逼真的对话质感。

性能上,Gemini 3.8 Flash TTS在Hume AI的语音设计基准拿到71.4分排总体第一,口音建模60.8分也领先,两款模型在Hume AI整体质量指数里分列第一和第二,比上一代3.1 Flash TTS在长格式和双扬声器控制上进步明显,在Voice Arena的盲测里也于日语、巴西葡萄牙语、越南语等多国语言中领先。谷歌在语音复制里强制要求口头同意验证,每个生成的音频片段都织入了难以察觉的SynthID水印,便于识别AI生成内容。即日起开发者就能在Google AI Studio和Gemini API里体验,企业版很快通过Gemini Enterprise推出,普通用户则能在Gemini Notebook和Google Vids里分别用上这两款模型。需要注意的是,通过AI Studio进行的语音复制在伊利诺伊州、德克萨斯州、欧洲经济区、英国、瑞士和印度暂时不可用。

特别提醒:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字、图片等内容的真实性、完整性、及时性本站不作任何保证或承诺,请自行核实相关内容。本站不承担此类作品侵权行为的直接责任及连带责任。如若本网有任何内容侵犯您的权益,请及时发送相关信息至bireading@163.com,本站将会在48小时内处理完毕。

谷歌推出Gemini 3.8 Flash/Flash-Lite语音模型:每行台词都能精细操控

2026-09-24 15:05:22 浏览量: 6826 作者: 嫣然

9月24日,谷歌今天宣布,Gemini家族新增两款文本转语音模型,把语音生成从过去的静态预设变成了一个动态创意工作室,帮创作者、开发者和企业做出更有表现力的音频,也为Gemini Notebook和Google Vids等产品改进了体验。两款新模型分别是Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS,定位各有侧重:前者面向深度的创意方向和角色设计,能用自然语言提示从头造出新语音,在游戏、沉浸式有声读物和互动媒体里赋予角色生命力,还能精细控制表演提示、节奏和方言转换;后者面向大容量、高性价比的规模场景,针对大批量配音和富有表现力的语音代理做了优化,对音调、节奏和表现力的细微差别都能精细拿捏。

在声音来源上,用户可以从原先30种原始语音扩展到无限语音库。生成式语音设计允许用自然语言提示,在100多种语言和方言里自定义角色、口音和语音特征,从头创建定制声音;扩展语音库则提供2000多种现成语音,覆盖墨西哥西班牙语、魁北克法语、苏格兰英语等区域变体;语音复制只要30秒音频样本就能重现一致的声音特征,并内置同意验证、SynthID水印和C2PA凭据来保护开发者和声音人才;自定义语音还能保存管理,尽量减小漂移。选好声音后,两款模型都能精确控制每一行台词的演绎方式,你可以自己写舞台指导,也可以让Gemini用自然脚本提示来引导交付,无论是平静的客服还是低声的悬疑场景都不在话下。长篇生成能在数小时连续音频里保持高质量和稳定音色,原生双声音场景编排则能从一个脚本里无缝指导多轮对话,再加上笑声、叹息这类非语言提示,凑出逼真的对话质感。

性能上,Gemini 3.8 Flash TTS在Hume AI的语音设计基准拿到71.4分排总体第一,口音建模60.8分也领先,两款模型在Hume AI整体质量指数里分列第一和第二,比上一代3.1 Flash TTS在长格式和双扬声器控制上进步明显,在Voice Arena的盲测里也于日语、巴西葡萄牙语、越南语等多国语言中领先。谷歌在语音复制里强制要求口头同意验证,每个生成的音频片段都织入了难以察觉的SynthID水印,便于识别AI生成内容。即日起开发者就能在Google AI Studio和Gemini API里体验,企业版很快通过Gemini Enterprise推出,普通用户则能在Gemini Notebook和Google Vids里分别用上这两款模型。需要注意的是,通过AI Studio进行的语音复制在伊利诺伊州、德克萨斯州、欧洲经济区、英国、瑞士和印度暂时不可用。

,

Copyright ©2018 铋读网 All Rights Reserved.

京ICP备18051707号

京公网安备 11011302001633号