谷歌推出Gemini 3.8 Live与Live Extended Thinking:迄今最先进实时对话模型
9月16日,据报道,谷歌宣布推出Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking。谷歌称这是其迄今最先进的实时对话模型,在智能和并行推理方面有重大升级,让AI对话更直观智能。
两款新品分别为面向规模部署与成本优化的Gemini 3.8 Live,以及面向高复杂度任务、强化多步推理能力的Gemini 3.8 Live Extended Thinking。Gemini 3.8 Live兼顾对话智能、流畅交流和视觉理解,面向规模化与成本效率;Gemini 3.8 Live Extended Thinking面向高复杂度任务,具备更强的智能和多步推理能力。后者在多项基准测试中取得领先成绩:拿下Artificial Analysis语音对语音质量指数总排名第一(82.6%),在τ-Voice智能体任务完成率达68.6%,在Sierra的τ-Voice-banking基准测试达35.1%;推理能力方面,在Big Bench Audio得分97.7%,同时保持有竞争力的定价。Gemini 3.8 Live则在Speech Agent Arena排名第二,具备出色成本效益,适合大规模部署。
两款模型在ServiceNow EVA-Bench语音智能体基准测试中成功平衡准确性与对话质量,推高了复杂工作流的帕累托前沿。Gemini 3.8 Live可近实时处理视觉输入,在对话中自动检测并切换97种支持的语言,还能在后台执行工具与API调用,同时保持对话流畅不中断。
针对需要深度推理的任务,Gemini 3.8 Live Extended Thinking可实现推理与发言同步进行,在不中断对话流畅度的前提下提升复杂工作流智能水平,通过“让我确认一下……”这类早期语言提示自然回应提示,还可实时讲解多步后台任务处理进度。
开发者可通过Gemini Live API,在声网、Fishjam、LiveKit、Pipecat、Vercel、Vision Agents等平台构建部署高性能语音驱动界面;谷歌还与Salesforce、Genspark、Lumeris等企业开展合作。谷歌所有AI生成音频均添加SynthID隐形水印,可检测AI生成内容。
目前Gemini 3.8 Live已开始推送:开发者可在Gemini API和Google AI Studio使用;企业用户可在Gemini Enterprise抢先体验,即将登陆Gemini Enterprise for Customer Experience;全用户可在Search Live体验。Gemini 3.8 Live Extended Thinking也已开启推送:开发者可在Gemini API和Google AI Studio使用;企业用户可在Gemini Enterprise抢先体验;普通用户可在Gemini Live体验,Google AI Pro和Ultra订阅者可在Google Workspace的Docs使用,所有Google AI订阅者可在Gmail和Keep体验。