返回行业动态
模型与产品

Black Forest Labs发布Flux 3:从图像模型进化为多模态基础模型,进军物理AI

德国AI实验室Black Forest Labs于7月23日正式发布Flux 3多模态基础模型。与此前仅能生成图像的Flux 1和Flux 2不同,Flux 3基于Self-Flow(自监督流匹配)学习框架,将视频、音频和图像生成能力统一到同一架构中,并首次支持单次生成最长20秒的带音效视频片段。在初步评测中,Flux 3得分超过Seedance 2.0、Gemini Omni和Grok Imagine等竞品。更具战略意义的是,Black Forest Labs同时发布了Flux-mimic机器人动作模型,正在与奥迪等制造合作伙伴进行测试,标志着公司正式从生成式AI拓展至物理AI领域。

来源:Black Forest Labs官方博客 × IT之家原标题:Introducing FLUX 3: A Multimodal Foundation Model查看原文
Black Forest Labs Flux 3多模态模型概念图:从图像到视频到物理AI的进化

图片来源:北京拓实科技原创

发生了什么

德国知名AI研究实验室Black Forest Labs(黑森林实验室)于7月23日以Early Access方式正式发布Flux 3多模态基础模型。该实验室由前Stability AI核心团队于2024年创立,此前以Flux系列图像生成模型闻名。

Flux 3的核心突破在于架构统一:基于Self-Flow学习框架,将图像、视频、音频的生成与理解整合到一个模型中。官方称其配备了专用的图像、视频、音频及动作编解码器,可实现对物理与数字环境的统一感知。在初步评测中,Flux 3的得分已超过Seedance 2.0、Gemini Omni和Grok Imagine。

关键进展

  • 多模态统一:Flux 3不再只是图像模型,而是同时处理视频、音频和动作预测的真正多模态基础模型。
  • 视频生成:支持单次生成最长20秒的多样化视频片段,并支持带音效输出。
  • 物理AI拓展:与Mimic Robotics AG合作开发Flux-mimic动作模型,已在奥迪等制造场景进行测试。
  • 开源承诺:Black Forest Labs表示Flux 3最终将开源,延续其开放模型传统。

为什么重要

Flux 3的发布标志着多模态AI的竞争从「专有模型各管一段」进入「统一架构同时覆盖视、听、动」的新阶段。从图像生成到视频、音频再到机器人动作控制,Black Forest Labs的演进路径揭示了一个重要趋势:生成式AI和物理AI正在同一技术栈上融合。

对制造业、自动驾驶和机器人行业的企业而言,Flux 3的Flux-mimic分支提供了直接的应用前景——一个能从视觉和音频输入中学习并预测动作的模型,有潜力降低机器人编程和训练的门槛。但Flux 3目前仍处于Early Access阶段,大规模部署的可靠性、成本和延迟等指标尚待验证。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。