Black Forest Labs发布FLUX 3,扩展至视频与机器人

Black Forest Labs发布FLUX 3,扩展至视频与机器人

摘要

Black Forest Labs 推出 FLUX 3,支持最长 20 秒视频与同步音频生成,并将同一底层能力用于机器人控制,奥迪已开始测试 。

德国 AI 公司 Black Forest Labs 推出 FLUX 3 早期版本,这是其旗舰模型首次从静态图像生成扩展到视频生成。该模型可生成最长 20 秒的视频,并同步输出与画面匹配的音频。公司同时将同一底层能力用于机器人控制,奥迪已开始在生产线测试相关系统。

从图像模型转向多模态生成

Black Forest Labs 以 FLUX 图像生成模型受到关注。此次发布的 FLUX 3 不再只处理单一图像任务,而是将图像、视频和音频放入同一套系统训练。按照公司的说法,这意味着模型不只是生成画面,也在学习物体运动、接触和时序关系。

视频是这次更新的核心功能。FLUX 3 目前可生成最长 20 秒的视频片段,音频会与画面同步输出,包括对白、环境声和音效。

  • 对 Runway Gen-4.5 的偏好率为 77%
  • 对 Luma Ray 3.2 的偏好率为 93%
  • 对 Gemini Omni 和 Seedance 的胜率为 52%

不过,这类结果属于主观偏好测试,并非统一量表下的固定评分。

同一底层模型进入机器人场景

Black Forest Labs 将这套视频预测能力进一步用于机器人系统,推出了与苏黎世公司 mimic robotics 联合开发的 FLUX-mimic。该系统在 FLUX 3 的基础上增加了解码组件,用于把模型对动作和运动的内部表征转化为实际机器人操作。

公司认为,能够预测视频中的运动过程,也意味着模型更接近理解真实世界中的重量、接触和时间差,这正是机器人执行物理任务所需要的能力。

目前,奥迪已经在生产线上测试这一系统,应用场景包括安装柔性车门密封条。这类涉及软性材料处理的任务,传统自动化方案通常更难完成。Black Forest Labs 称,整套系统的响应时间约为 101 毫秒,接近人类视觉反射水平。

开放策略仍然有限

Black Forest Labs 由曾参与 Stability AI 初代 Stable Diffusion 模型开发的研究人员于 2024 年 8 月创立。公司此前凭借 Flux Dev 和 Schnell 等模型,在开源图像生成领域迅速获得关注。

不过,FLUX 3 这次并未全面开放。当前 Video 和 Action 功能仅通过 API 和部分合作伙伴提供早期访问,图像生成功能将在未来几周上线。公司计划在 2026 年稍晚推出开放权重的 Dev 版本,这也是目前唯一计划支持本地部署的版本。