← 文章 / AI图像生成
Hacker News 2026/7/24 · 2026-07-24 20:06:02 · 29 阅读

FLUX 3发布:多模态流模型,迈向真实世界视觉智能

FLUX 3 - 真实世界模型:迈向多模态流模型,作为视觉智能的基石。

FLUX 3 现已开放早期体验。

FLUX 3 是我们新一代的多模态基础模型。它在统一架构中同时学习图像、视频和音频,因为模型需要学习的不是孤立地理解某一种模态,而是对世界的表征:物体如何结合、如何运动,以及事件如何发出声音。

任何单一模态都无法提供完整的描述。每种模态都是同一底层现实的一个投影,由不同传感器捕获,而每个传感器在过程中都会丢失一些信息。图像捕捉特定时刻的空间结构和关系;视频恢复了时间维度,揭示了时间动态和物理规律;音频揭示了视觉无法察觉的机械现象与声学之间的因果关系;语言则将这些感知与目标、抽象概念和指令联系起来。

只学习一种模态,你只能得到该投影的好模型。同时学习所有模态,它们之间的相互约束会告诉你更多:声音必须匹配撞击,运动必须遵循质量,未来必须延续过去。模态不再彼此孤立,而是成为同一底层现实的证据。

FLUX 3 是完全基于这一原则构建的第一个模型,也是我们开发真实世界视觉智能(即能够感知、预测并在物理与数字环境中行动的模型)使命中的一个里程碑。内容创作和物理 AI 的早期结果表明,这是一条正确的道路。

FLUX 3:一个模型,多种能力。

FLUX 3 基于我们提出的 Self-Flow 方法构建,该方法旨在同一底层架构下高效对齐多模态生成与理解。在此基础之上,我们大幅扩展了计算和数据资源,同时对视频、图像和音频进行训练,从而打造出 FLUX 3。

Self-Flow 与 Flow Matching (FM) 对比。左图:各模态的生成误差(Fréchet 距离),均以 FM = 100 进行归一化(越低越好)。右图:通过微调在四个任务组上平均的操作任务成功率(越高越好)。

能力与早期评估

因此,FLUX 3 能够混合模态,联合生成图像以及视频+音频;既可以从纯文本提示出发,也可以在提供图像和视频等输入参考时生成。下面我们重点介绍该模型的一些关键能力。

视频

FLUX 3 可一次性生成长达 20 秒、包含音频的多样化视频。

其核心能力包括(所有输出均自带原生音频生成):

  • 文本到视频生成
  • 图像到视频生成,既可以从起始帧继续(“动画”),也可以将图像作为视觉参考
  • 视频到视频生成,基于参考片段,将源视频的核心元素(例如同一角色)迁移到新场景或新语境中
  • 从输入视频和音频进行生成式视频-音频延续
  • 关键帧到视频生成,实现定义时刻之间的可控过渡
  • 多语言对话
  • 广泛的视觉风格和宽高比,远超传统电影级输出
  • 将单个片段智能串联为更长的多镜头序列
  • 高度多样性——FLUX 3 视频轻松驾驭从抓拍式摄像机镜头到动画和电影级画面的各种风格
  • 强大的文字排版生成和动画设计

在以下初步分析中,我们生成了720p、带音频的10秒文生视频片段。

评估尚处早期,后续还将持续改进

由于模型及其配套工具仍在开发中,目前结果仅为初步评估,我们预计在早期访问阶段会进一步提升。在早期对比评测中,FLUX 3相较于Grok Imagine Video获得了高达69%的偏好率,相较于Kling v3 Pro为60%,相较于Happy Horse v1为59%,相较于Happy Horse 1.1为57%,相较于Seedance 2.0和Gemini Omni Flash为52%。此外,FLUX 3相较于Runway Gen-4.5的偏好率达77%,相较于Luma Ray 3.2则高达93%。

尽管仍在开发中,FLUX 3 Video在捕捉人类面部表情、将声音与物理事件关联以及多语言能力方面已展现出特别出色的表现。这些能力还可以组合起来生成长达数分钟的序列,通过视觉参考确保各场景中角色的一致性。

FLUX 3 Video现已开放早期访问

图像

FLUX 3能够合成和编辑多种风格、宽高比和分辨率的图像。在训练中期进行的初步评估中,FLUX 3相比早期版本已有显著提升:处理复杂提示词和文本生成的能力大幅增强。该模型可生成多样化的输出(见下方示例),并能以高精度呈现多语言文字。

与视频评估类似,以上均为初步结果,我们预计在正式发布前还会进一步改进。FLUX 3 Image的早期访问将在未来几周内开放。

动作

FLUX 3的世界理解能力已扩展至动作预测。我们通过两条路径实现:一是直接将原生动作预测集成到FLUX 3中,基于我们最初在Self-Flow上的工作进行了扩展;二是利用预训练的视频骨干网络作为动态感知基础,专用动作模型可在此基础上利用少量任务特定数据进行微调。

在第二条路径上,mimic robotics是首批获得FLUX 3早期访问权限的合作伙伴之一。我们共同开发了FLUX-mimic,这是一个视频-动作模型,结合了FLUX 3骨干网络与mimic在机器人学习方面的专长,用于灵巧操作和生产部署。阅读我们的论文,了解物理AI与内容创作为何基于同一基础,以及该模型如何在奥迪的真实生产任务中进行测试。

发布计划

在接下来的几周到几个月内,我们将逐步开放以下能力,每项能力在早期访问阶段后正式推出,以确保平稳部署、收集反馈并进行严格的安全测试。所有能力均基于同一底层多模态流匹配模型构建。这些能力和模型包括:

  • 通过API和私有权重访问实现视频和音频生成与编辑。(“FLUX 3 Video”)
  • 通过选定的研究和商业合作伙伴提供动作预测,首期合作方为mimic robotics(“FLUX-mimic and FLUX 3 Action”)
  • 通过API和私有权重访问实现图像合成与编辑。(“FLUX 3 Image”)
  • 开放多模态骨干网络的权重访问,用于内容创作(视频、音频和图像)以及动作预测。(“FLUX 3 Dev”)

我们还将发布更多关于底层方法的技术细节。

在此申请早期访问

下一步计划?

我们才刚刚触及多功能、强大、统一的多模态模型及其所能带来的可能性的皮毛。从交互式图像与视频编辑、模拟,到计算机使用和物理AI,前沿领域广阔无垠。在逐步推出这些新能力的同时,我们已经在着手开发下一代模型。我们的目标是:将感知、动作和语言预测统一到同一个模型之中。

如果你有兴趣探索和基于FLUX 3构建,请联系我们。如果你有兴趣为我们的使命贡献力量,欢迎加入!我们在德国和美国正在招聘

原始来源: Hacker News

评论 (0)