← 文章 / AI技术
Hacker News 1天前 · 2026-07-24 20:06:02 · 0 阅读

FLUX 3发布:多模态流模型,迈向真实世界视觉智能

返回博客
  • 模型
  • 研究

FLUX 3 - 真实世界模型:迈向多模态流模型,作为视觉智能的骨干

FLUX 3 - Real World Models: Towards Multimodal Flow Models as the Backbone of Visual Intelligence.

FLUX 3 现已开放早期访问。

FLUX 3 是我们的新一代多模态基础模型。它在统一架构中同时学习图像、视频和音频,因为模型需要学习的并非孤立地理解这些元素中的任何一个,而是世界的表征:物体如何组合、如何运动、如何发声。

单一模态无法提供完整描述。每种模态都是同一底层现实的一个投影,由不同传感器捕获,但每个传感器都会丢失一些信息。图像捕捉特定时刻的空间结构与关系;视频还原时间维度,揭示时间动态与物理规律;音频揭示机械现象与声学之间的因果关系,这是视觉无法感知的;语言则将上述感知与目标、抽象概念和指令联系起来。

只学习一种模态,你只能得到该投影的良好模型;同时学习所有模态,它们之间的相互约束会告诉你更多:声音必须与撞击匹配,运动必须服从质量,未来必须遵循过去。模态不再彼此孤立,而成为同一底层现实的证据。

FLUX 3 是完全基于这一原则构建的首个模型,也是我们实现真实世界视觉智能使命的一个里程碑——即能够感知、预测并在物理与数字环境中行动的模型。在内容创作和物理 AI 领域的早期结果表明,这条道路是正确的。

FLUX 3:一个模型,多种能力。

FLUX 3 基于我们提出的 Self-Flow 方法构建,该方法能在同一底层架构中高效对齐多模态生成与理解。在此基础上,我们大幅扩展了计算和数据资源,同时训练 FLUX 3 处理视频、图像和音频。

Self-Flow 与 Flow Matching (FM) 对比。左:各模态的生成误差(Fréchet 距离),均归一化到 FM=100(越低越好)。右:在四个任务组上通过微调测得的操控任务成功率平均值(越高越好)。

能力与早期评估

因此,FLUX 3 能够混合模态,从纯文本提示或提供图像、视频等输入参考,联合生成图像和视频+音频。下面我们重点介绍该模型的几项核心能力。

视频

FLUX 3 能一次生成最长 20 秒、带音频的高度多样化视频。

其核心能力包括(所有输出均自带原生音频生成):

  • 文本生成视频。
  • 图像生成视频:可从起始帧延续(即“动画”)或使用图像作为视觉参考。
  • 视频生成视频:从参考片段出发,将源视频的核心元素(如同一角色)带入新场景或语境。
  • 基于输入视频和音频的生成式视频-音频延续。
  • 关键帧生成视频:在定义时刻之间实现受控过渡。
  • 多语言对话。
  • 丰富多样的画面和宽高比,远不止传统的电影级输出。
  • 智能串联:将单个片段衔接成更长的多镜头序列。
  • 高度多样性:FLUX 3 视频轻松覆盖从随手拍摄的摄像机素材到动画和电影级画面的各种风格。
  • 强大的文字排版生成和动画设计。

在以下初步分析中,我们生成了720p、10秒的文本生成视频片段,并配有音频。

评估尚早,期待进一步优化

由于模型及配套工具仍在开发中,目前结果仅为初步数据,我们预计在早期访问阶段还将持续改进。早期评估中,FLUX 3 在对比测试中表现优于以下竞品:Grok Imagine Video(69%)、Kling v3 Pro(60%)、Happy Horse v1(59%)、Happy Horse 1.1(57%)、Seedance 2.0 和 Gemini Omni Flash(52%)。此外,FLUX 3 在 77% 的对比中优于 Runway Gen-4.5,在 93% 的对比中优于 Luma Ray 3.2。

尽管仍在开发中,FLUX 3 Video 在捕捉人类面部表情、将声音与物理事件关联以及多语言能力方面已表现出色。这些能力还能组合使用,生成持续数分钟的片段,且视觉参考有助于确保角色在所有场景中保持一致。

FLUX 3 Video 现已开放 早期访问

图像

FLUX 3 可合成和编辑各种风格、宽高比和分辨率的图像。在训练中期进行的初步评估中,FLUX 3 相比早期版本已有显著提升:处理复杂提示词和文本生成的能力大幅增强。该模型输出范围广泛(参见以下示例),并能高精度渲染多语言文本。

与视频评估类似,这些均为初步结果,我们预计在正式发布前会进一步改进。未来几周内,我们将开放 FLUX 3 Image 的早期访问阶段。

行动

FLUX 3 对世界的理解已延伸至动作预测。我们通过两条路径实现:一是将原生动作预测直接集成到 FLUX 3 中,并在此前 Self-Flow 工作的基础上进行规模化扩展;二是将预训练的视频骨干网络作为具备动力学感知的基础模型,让专用动作模型仅需少量任务数据即可进行微调。

在第二条路径上,mimic robotics 是首批获得 FLUX 3 早期访问权限的合作伙伴之一。我们共同开发了 FLUX-mimic,这是一款结合了 FLUX 3 骨干网络与 mimic 在灵巧操作及生产部署方面机器人学习专长的视频-动作模型。 阅读我们的论文,了解为什么物理 AI 和内容创作基于同一基础,以及该模型如何在奥迪的真实生产任务中进行测试。

发布计划

在未来几周至几个月内,我们将逐步开放以下功能,每项功能均会在早期访问阶段确保平稳上线、收集反馈并经过严格的安全测试。所有功能均基于同一底层多模态流匹配模型构建,具体包括:

  • 通过 API 和私有权重,提供视频与音频的生成及编辑功能(“FLUX 3 Video”)
  • 通过精选的研究与商业合作伙伴(首先从 mimic robotics 开始)提供动作预测功能(“FLUX-mimic 和 FLUX 3 Action”)
  • 通过 API 和私有权重,提供图像生成与编辑功能(“FLUX 3 Image”)
  • 开放多模态骨干网络的权重,用于内容创作(视频、音频、图像)及动作预测(“FLUX 3 Dev”)

我们还将发布关于底层技术的更多细节。

在此申请早期访问权限

接下来是什么?

我们才刚刚触及多功能、高性能、统一多模态模型的表面,以及它们所能带来的可能性。从交互式图像与视频编辑、仿真,到计算机使用和物理 AI,前沿领域十分广阔。在逐步推出这些新功能的同时,我们已经在着手开发下一代模型。我们的目标是将感知、动作和语言预测统一到同一个模型之中。

如果你有兴趣探索和基于 FLUX 3 进行开发,请在此联系我们。如果你愿为我们的使命贡献力量,欢迎加入我们!我们在德国和美国正在招聘

原始来源: Hacker News

评论 (0)