谷歌推出Gemini Omni 1.1 Flash视频生成模型:最高支持4K输出,精准控制视频创作全流
8月28日,谷歌宣布推出Gemini Omni 1.1 Flash视频生成AI模型,为开发者和专业创作者带来更高水平的视频生成可控性与画质表现。该模型现已在Google AI Studio中通过Gemini API向开发者开放,企业用户可通过Gemini Enterprise Agent Platform API获取服务。
Gemini Omni 1.1 Flash在视频生成控制力上实现了显著提升:
- 场景扩展:基于已有视频无缝延续生成,模型可分析最长10秒的先前画面作为上下文(此前仅能参考最后1秒),支持每次10秒步长扩展,单条视频累计最长达40秒。
- 首尾帧指定:通过锁定镜头的起始与结束画面,实现平滑自然的转场运镜,适用于复杂镜头环绕、缩放过渡或无缝循环剪辑。
- 视频参考输入:支持引入最长3秒的参考视频片段,精准维持角色外观与视觉上下文的一致性。
- 360p草稿预览:相较标准720p分辨率,生成速度最高提升60%,成本仅需三分之一,适合快速原型验证与分镜迭代。
- 最高4K分辨率:可直接输出画质细腻的1080p或4K最终成片。
此外,与谷歌此前侧重“理解世界”的视频模型不同,Omni 1.1 Flash专为专业生产场景设计,提供多档分辨率选项以适应从草稿到成片的完整工作流。据Google官方博客介绍,Omni 1.1 Flash的每段生成视频都包含对观众不可见但可机器检测的SynthID数字水印,便于内容来源追溯。
伴随视频生成成本持续下降,短视频、广告与概念片的制作门槛正在被重新定义。谷歌通过提供从草稿到成片的分级方案,试图将AI视频生成塑造为创意工作流中可控、可负担、可迭代的常规环节,而非一次性的演示炫技。