Black Forest Labs推出多模态模型FLUX 3,可生成带原生音频的20秒视频
7月24日,据报道,以图像生成模型FLUX系列闻名的AI实验室Black Forest Labs,近日正式发布了其新一代多模态基础模型FLUX 3,标志着该系列从图像生成迈入了原生多模态生成的新阶段。
与市面上许多通过拼接独立模型实现多模态的方案不同,FLUX 3的核心在于从一开始就联合训练图像、视频和音频,所有模态共享一个统一的架构。Black Forest Labs认为,要生成逼真的视频,模型别无选择,只能学习物理世界的接触、运动、重量和因果效应。这种对世界的理解,正是其进军具身智能领域的基石。
在视频生成方面,FLUX 3能够根据单次提示生成最长20秒的连贯视频片段,并附带原生生成的音频,支持文生视频、图生视频、视频生视频等多种形式。在初步的人工对比评测中,一段10秒720p的视频生成效果,FLUX 3与谷歌的Gemini Omni Flash的胜率持平(均为52%),而高于Grok Imagine Video(69%)和Seedance 2.0(52%)等模型。
FLUX 3的野心不止于内容创作。其统一的架构使其预测“行动”成为可能——机器人领域所需的动作预测与音视频生成共享同一个世界模型。Black Forest Labs已与机器人公司mimic合作,基于FLUX 3打造了“视频-行动”模型FLUX-mimic,并已在奥迪的生产线上进行实际部署测试,用于处理零件装配、柔性材料操作等精细任务。训练数据显示,在模型中增加行动预测能力后,其视频生成质量在短暂下降后迅速恢复,证明同一套架构能够同时承载内容创作与物理世界交互两种能力。Black Forest Labs CEO Robin Rombach表示,公司聚焦于构建能够理解世界的模型,而“在物理世界中行动”正是这种理解所能实现的价值体现。
目前,FLUX 3 通过“Early Access”计划向申请用户开放,初期提供视频、图像和行动三个产品线。其中 FLUX 3 Image 将在未来几周内推出,而备受关注的开源权重版本(FLUX 3 Dev)则计划于今年晚些时候发布。值得注意的是,FLUX 3 Dev将首次开放用于行动预测的多模态模型权重,这比以往的FLUX Dev系列仅开放图像生成权重迈出了更大一步。Black Forest Labs目前已获得约4.5亿美元融资,估值达32.5亿美元,合作伙伴包括Adobe、Canva、NVIDIA等。