← 文章 / AI图像生成
Hacker News 2026/7/25 · 2026-07-25 00:18:16 · 25 阅读

FLUX 3 × Mimic:新一代视频-动作模型

FLUX 3 x mimic: The Next Generation of Video-Action Models

FLUX 3的早期版本——我们新的多模态基础模型——现已部署在机器人上运行。我们向mimic robotics提供了FLUX 3的早期访问权限。mimic在机器人学习和部署方面的优势,结合该模型的世界知识以及BFL的基础模型专长,共同打造了FLUX-mimic:新一代视频-动作模型。

FLUX

FLUX 1和FLUX 2生成图像。FLUX 3则扩展至多模态,能够联合生成视听内容——同时,它为FLUX-mimic奠定了基础:这是一个与mimic合作开发的视频-动作模型,驱动着已在奥迪完成测试并部署的机器人。

乍看之下,生成逼真的视觉内容与控制机器人似乎毫不相干。前者需要生成像素,后者则需要理解物理世界在被触摸和操控时如何响应。如果一个模型能同时做到这两点,它本质上就从来不仅仅是一个内容创作模型,而是一个理解世界运行方式的模型,内容创作只是其能力之一。

这就是FLUX 3的本质。

视频才是难点

FLUX 3是一个从头开始就在图像、视频和音频上联合训练的模型。训练中计算成本最高(超过总计算成本的95%)的部分是视频预测。为了生成逼真的视频,模型必须学会理解接触、运动、重量、因果;任何一项出错,画面都会失真。学会准确渲染世界,就意味着学会世界如何运作。

相对而言,音频是简单的模态。维度低、细节远不如视频,在720p带音频的视频中,音频token占比不到0.5%。一旦模型完成了学习视频理解这一艰巨任务,它就能学会视频与音频之间的因果关系,预测与嘴唇运动同步的语音,以及与物理事件同步的音效。

动作遵循相同的形态:即机器人状态的低维表示,与视觉观测紧密耦合。动作、音频和视频帧,都是同一底层物理现实的部分表征。当模型学会了视频和音频背后的物理过程后,动作预测便不再是全新的任务——它只是模型已建模的现实又多了一个视角。

单一骨干

如果这个框架是正确的,那么教会 FLUX 3 预测动作不会带来持续的成本:我们预期会出现短暂的扰动期,因为模型需要学习动作空间的结构,并将其内部世界表征与之对齐,随后便会恢复全部性能。这正是我们观察到的现象。 在一次大规模训练中,我们将动作预测加入课程,并观察其对视频生成质量的影响。随着模型开始融入新的动作模态,人类对文生视频和图生视频的评分起初下降了多达 10%。经过 3500 步后,模型在视频生成任务上已完全恢复之前的质量,同时还具备了动作预测能力。

每条曲线均已归一化到其自身在加入动作预测前的质量水平。数值越高越好。

模型需要将动作整合到其输入和输出中——但这并没有永久性地消耗其容量。它只是需要学习这个新模态如何与其现有的世界模型关联。一旦弄明白了这一点,对现有能力的性能损失就消失了。视频生成和动作预测不需要各自独立的基础。同一个骨干承载两者。 这使得物理 AI 成为 Black Forest Labs 路线图的自然延伸,而非方向转变。内容创作是我们多模态 FLUX 3 骨干在处理图像、视频和音频时的能力;物理 AI 则是它处理动作时的能力。一个以视觉智能为核心的基础模型,赋能了两类应用。我们没有构建独立的基础模型。我们专注于最难的事情:构建一个理解世界的模型。而理解世界的意义,正在于让行动成为可能。

从实验室到现实:FLUX-mimic

当我们将FLUX 3主干网络应用在真实产线上的自动化任务时,会发生什么?

这正是mimic与BFL打造FLUX-mimic想要回答的问题。mimic自主制造机器人,在机器人学习、灵巧操作和产线部署方面经验丰富;BFL则构建视觉基础模型,擅长多模态训练与建模。双方联手,打造了一款面向通用操作的下代模型——它适应工业需求,并集成到mimic的全栈部署系统中。FLUX-mimic是基于FLUX 3主干网络的视频-动作模型。

解读学到的世界模型

我们的核心理念是:FLUX 3必须学习世界的内部表征才能生成视频。FLUX-mimic贯彻了这一理念,从FLUX主干网络学到的世界表征中解码出动作。这种方法在mimic-video中首创,它在FLUX视频预测路径提取的中间特征之上,训练了一个轻量级动作解码器。

FLUX-mimic在FLUX 3之上的架构概览

该方法成功与否取决于两个相关但不同的方面:FLUX学到的世界模型质量,以及该世界模型的特征表征质量。世界模型的质量直接关系到生成质量:如果模型不理解世界的运作方式,就无法模拟它。然而,即便拥有最好的世界模型,如果其特征空间让模态间的因果关系以非线性方式纠缠在一起,那么从特征表征理解这些关系依然和从原始输入理解一样困难——表征质量至关重要。

生成质量和表征质量长期以来一直被孤立研究。生成式方法能构建高质量的世界模型,支持仿真,并展现出可预测计算投入回报的规模定律。然而,与专门用于表征学习的方法相比,它们产生的表征解耦性较差,这限制了其在需要世界理解的任务中的实用性。

既然生成模型本身依赖自身的特征,这种表征质量上的分歧似乎有悖直觉。改进生成模型内部的表征,理应提升其世界模型的质量,并使其更适用于下游任务。在我们的工作 Self-Flow 中,我们展示了如何在单一框架中统一生成与表征学习,并观察到了这种相互促进:世界模型得到改善(通过视频、图像和音频的生成质量衡量),同时其表征质量也得到提升(通过模拟中机器人控制任务的成功率衡量)。

Self-Flow vs. Flow Matching (FM)。左:各模态的生成误差(Fréchet距离),均归一化至FM = 100(越低越好)。右:通过微调,四个任务组的操作任务平均成功率(越高越好)。

扩展世界模型

Self-Flow 同样遵循缩放定律,FLUX 3 正是它的应用体现——一个更大规模的 Self-Flow 版本。模型在数千万小时的通用视频数据上训练,从一开始就尽可能广泛地学习世界动态;另外还使用数十万小时聚焦于人类和机器人操作任务的视频数据,使其成为视觉智能的骨干。正是这种规模扩展,让 Self-Flow 从实验室走向现实。mimic 已将 FLUX-mimic 部署到真实的工厂场景中,覆盖生产和物流的日常:将零件装入分层托盘、将电子控制单元插入紧密配合的夹具、组装零部件,以及处理密封件和线缆等柔软可变形的材料——这些是传统自动化从未能够触及的。

基准测试表明,即使 FLUX 骨干网络完全冻结(在此设置下以往的视觉-语言-动作模型无法成功),动作解码器仍然优于之前的视觉-语言-动作模型。这凸显了规模扩展赋予骨干网络强大的世界知识以及如何在该世界中行动的知识,而 Self-Flow 则使这些知识能够从骨干网络的特征表示中轻松解码。当骨干网络与动作解码器一起微调时,FLUX-mimic 达到了最先进的成功率。

虚线表示每个模型在 20 次自主试验中的中位成功率。越高越好。

从世界知识到具体任务

骨干网络以可解码的表示形式呈现世界知识,这改变了教授机器人新任务的方式。如果物理规律已经包含在表示中且易于获取,那么适应新任务就不再需要教模型了解世界如何运作——它只需要学习这个特定任务如何映射到它已经知道的知识上。最昂贵的部分在机器人开始移动之前就已经完成了。

这直接体现在新任务需要多少示范数据上。在我们的 Self-Flow 实验中,与没有 Self-Flow 的视频模型相比,动作预测达到相同成功率所需的训练步骤减少了一半——更好的表征让世界知识更容易提取,因此达到相同能力所需的数据更少。mimic-video 论文报告称,视频-动作模型的样本效率比视觉-语言-动作模型高出至多 10 倍;FLUX-mimic 则结合了这两方面的优势。

同样的优势也体现在行为上。FLUX-mimic 能自然地从失败中恢复:抓取失败的机器人会自动纠正,重新抓取,最终完成任务。没有任何示范集能覆盖任务可能出错的每一种方式。从未被演示过的恢复能力必须来自别处——来自一个已经理解世界运作方式的模型。

骨干网络预测的未来(上方),以及机器人根据解码动作执行的实际轨迹(下方)。

足够快,才能行动

真实世界的部署有一个硬约束:模型必须跟得上世界的运动速度。FLUX-mimic 的主要计算开销集中在骨干网络上。它是模型中最大的部分,在 mimic 优化后的部署栈中,其延迟实际上决定了整个系统的上限。

这正是我们方法论的第二次回报。更好的表征意味着每个参数能带来更强的能力:一个学习了良好结构化世界模型的模型,达到相同性能水平所需的容量比未学习的模型更小。在部署中,这直接转化为可以使用更小的骨干网络——而更小的骨干网络意味着更快的速度。

1.0M 训练步数下的 CLIP 分数;越高越好。骨干网络深度是部署延迟的主要决定因素,因此层数越少,模型越快。

最终,FLUX-mimic 的骨干网络可以优化到在单块 NVIDIA RTX 5090 GPU 上从输入到世界表征仅需不到 80ms——这与人类视觉反应时间处于同一数量级。

实际部署需要对整个技术栈进行额外优化,以避免增加额外延迟:mimic 的优化范围从动作解码器开始,贯穿传感器、模型与执行器之间的进程间延迟削减,再到实时分块处理,使预测与执行重叠,从而让机器人流畅运行、无抖动。最终形成一个自包含的机器人系统,反应时间仅需 101 毫秒。

在工厂车间

所有这一切都回到了自动化真正重要的地方:工厂。奥迪拥有汽车行业最自动化的生产网络之一,这使其能精准洞察传统自动化仍止步于哪些环节。尽管在机器人技术领域投入了数十年,但涉及柔性零件和精细操作的任务始终依赖人工,这主要出于经济原因:高端生产的多样化品种使得传统编程式的机器人单元针对每种情况重新设计成本过高。基于学习的系统改变了这一局面。

“奥迪与 mimic 合作,一直在测试和部署 FLUX-mimic。我们看到这些机器人完成了传统机器人根本不可能实现的复杂软体操作任务。这将在协助员工、提升效率以及扩展生产和物流环节的柔性自动化方面产生重大影响。对我们而言,与 mimic 和 Black Forest Labs 等前沿公司合作,对于推动物理人工智能的前沿,并在真实生产环境中验证这些创新至关重要。”——奥迪生产实验室 Christoph Schneider

结语

FLUX-mimic 是专为机器人设计的模型,也是未来方向的证明。它的样本效率与鲁棒性源自 FLUX 3 主干网络及其所暴露的表征质量,而非任务特定的工程技巧。这正是该方案能够跨任务、跨行业、跨硬件迁移的原因。更多内容请通过 mimic 了解。

一个以视觉智能为核心的模型,能够生成图像、视频和音频——并在生产线上驱动机器人。内容创作与物理人工智能,是同一基础的两类应用。

原始来源: Hacker News

评论 (0)