← 文章 / AI技术
Hacker News 1天前 · 2026-07-25 00:18:16 · 2 阅读

FLUX 3 × Mimic:新一代视频-动作模型

FLUX 3 × Mimic:新一代视频-动作模型FLUX 3 × Mimic:新一代视频-动作模型

FLUX 3(我们的新多模态基础模型)的早期版本已在机器人上运行。我们向 mimic robotics 提供了FLUX 3的早期访问权限。mimic在机器人学习与部署方面的优势,加上该模型的世界知识以及BFL的基础模型专长,共同催生了FLUX-mimic——新一代视频-动作模型。

FLUX

FLUX 1和FLUX 2生成图像。FLUX 3扩展到多模态,能够联合生成视听内容——同时,它也为FLUX-mimic奠定了基础:这是一个与mimic合作开发的视频-动作模型,驱动着已在奥迪完成测试和部署的机器人。

乍一看,生成逼真的视觉内容和控制机器人似乎没什么共同点:前者需要生成像素,后者则需要理解物理世界在触摸和操控时如何响应。如果一个模型能同时做到两者,那它从一开始就不只是内容创作模型——它是关于世界如何运作的模型,内容创作只是其用途之一。

这就是FLUX 3。

视频是难点

FLUX 3是单一模型,从头开始联合训练图像、视频和音频。训练中最耗资源的部分——占总算力成本超过95%——是视频预测。要生成逼真的视频,模型必须学会接触、运动、重量、因果逻辑;任何一项出错,视频看起来就会不对劲。学会准确渲染世界,就意味着学会世界如何运作。

相对而言,音频是简单模态。维度低、细节远少于视频,在720p含音频视频中,音频token占比不足0.5%。一旦模型完成了视频理解的艰巨任务,它就能学习视频与音频之间的因果关系,从而预测与唇部运动同步的语音,以及与引发它们的物理事件同步的音效。

动作遵循同样的形态:它是机器人状态的低维表示,与视觉观测紧密耦合。动作、音频和视频帧,都是同一个底层物理现实的部分表征。模型一旦学会了视频和音频背后的物理过程,预测动作就不再是新的课题——它只是对模型已经建模的现实又多了一个视角。

单一骨干

如果这个框架成立,那么教 FLUX 3 预测动作并不会带来永久性代价:我们预期会出现短暂的干扰期,因为模型需要学习动作空间的结构,并将其内部的世界表征与之对齐,之后才能恢复全部性能。我们观察到的正是如此。

在大规模训练中,我们将动作预测加入训练课程,并观察其对视频生成质量的影响。随着模型开始融合新的动作模态,文本到视频和图像到视频的人工评分起初下降了多达 10%。3500 步之后,模型不仅恢复了视频生成任务的原有质量,还同时具备了预测动作的能力。

每条曲线在加入动作预测前都按自身质量做了归一化处理。数值越高越好。

模型必须将动作整合到输入输出中——但这并未永久消耗其能力。它只是需要学习这一新模态如何与已有的世界模型相关联。一旦搞清楚了这一点,对原有能力的性能损失就消失了。视频生成和动作预测并不需要各自独立的基础,它们由同一个主干承载。

这使得 Physical AI 成为 Black Forest Labs 路线图的自然延伸,而非方向转变。内容创作是我们的多模态 FLUX 3 主干在处理图像、视频和音频时所做的事情,而 Physical AI 则是它处理动作时所做的事情。同一个基座模型,以视觉智能为核心,支撑起两大应用家族。我们并没有构建一个单独的基座模型,而是专注于最困难的事情:构建一个理解世界的模型。而在这个世界中行动,正是这种理解所赋予的能力。

从实验室到现实:FLUX-mimic

当我们把 FLUX 3 主干网络应用到真实产线上的自动化任务时,会发生什么?

这正是 mimic 和 BFL 打造 FLUX-mimic 要回答的问题。mimic 自研机器人,在机器人学习、灵巧操作和生产部署方面经验丰富;BFL 构建视觉基础模型,在多模态训练和建模上技术深厚。双方合作,共同打造了面向通用操作的新一代模型——适配工业需求,并集成到 mimic 的全栈部署系统中。FLUX-mimic 是一个基于 FLUX 3 主干网络的视频-动作模型。

解读学习到的世界模型

我们的核心理念是:FLUX 3 必须学习一个世界的内部表征,才能生成视频。FLUX-mimic 延续了这一思路,从 FLUX 主干网络学到的世界表征中解码出动作。这种方法在 mimic-video 中首创:在 FLUX 视频预测路径的中间特征之上,训练一个轻量级的动作解码器。

FLUX-mimic 基于 FLUX 3 的架构总览

这种方法成功与否取决于两个相互关联但不同的方面:FLUX 学到的世界模型的质量,以及该世界模型的特征表征的质量。世界模型的质量直接关系到生成质量:如果模型不理解世界如何运作,就无法模拟它。然而,即使世界模型再好,如果它的特征空间将不同模态间的因果关系非线性地纠缠在一起,那么动作解码器依然无法有效利用——因为从特征表征中理解这些关系,和从原始输入中理解同样困难。表征质量至关重要。

生成质量和表征质量长期以来一直被孤立研究和处理。生成式方法能产生高质量的世界模型,支持模拟,并展现出可预测计算投入回报的缩放律。然而,与专门的表征学习方法相比,它们生成的表征解耦性较差,这限制了其在需要理解世界的任务中的实用性。

生成模型本身依赖自身特征,因此其在表征质量上的这种差异看似反直觉。生成模型中的表征改进应该能提升其世界模型的质量,使其更适用于下游任务。在我们的工作 Self-Flow 中,我们展示了如何在一个统一框架内融合生成与表征学习,并确实观察到了这种相互促进:世界模型得到了提升(以视频、图像和音频的生成质量衡量),表征质量也同步改进(以模拟中机器人控制任务的成功率衡量)。

Self-Flow 与 Flow Matching (FM) 对比。左图:各模态的生成误差(Fréchet距离),均以 FM = 100 归一化(越低越好)。右图:通过微调在四个任务组上平均的操作任务成功率(越高越好)。

扩展世界模型

Self-Flow同样遵循缩放定律,FLUX 3正是其应用——Self-Flow的放大版本。它训练于数千万小时的一般视频内容,从一开始就尽可能广泛地学习世界动力学;同时训练于数十万小时聚焦人类与机器人操作任务的视频内容,以成为视觉智能的骨干。正是这种缩放,将Self-Flow的成功从实验室带到了现实。mimic将FLUX-mimic部署到真实的工厂场景中,涵盖生产和物流工作的日常现实:将零件分拣到结构托盘内,将电子控制单元插入紧密配合的夹具,组装组件,以及处理密封件、线缆等传统自动化从未能触及的柔性材料。 基准测试表明,即使完全冻结FLUX骨干网络(在此设置下之前的视觉-语言-动作模型无法成功),动作解码器的表现仍优于之前的视觉-语言-动作模型。这凸显了缩放如何赋予我们的骨干网络对世界及其行动方式的深刻理解,以及Self-Flow如何使这些知识易于从骨干网络的特征表示中解码。当对骨干网络和动作解码器进行联合微调时,FLUX-mimic达到了最先进的成功率。 **虚线标记了每个模型在20次自主试验中的中位成功率,越高越好。** ### 从世界知识到实际任务 一个以可解码表示形式展现世界知识的骨干网络,改变了教机器人新任务的方式。如果物理规律已经存在于表示中且易于访问,那么适应新任务就不再需要教模型世界如何运作——它只需要学习这个特定任务如何映射到它已知的事物上。昂贵的工作在机器人开始移动之前就已经完成了。

这直接体现在新任务所需演示数据量的多少上。在我们的Self-Flow实验中,与未使用Self-Flow的视频模型相比,动作预测达到指定成功率所需的训练步骤减少了一半——更好的表征让世界知识更容易提取,因此达到相同能力所需的数据量更少。Mimic-video论文报告称,视频-动作模型相比视觉-语言-动作模型,样本效率提升高达10倍;FLUX-mimic则结合了两者的优势。

同样的优势也体现在行为上。FLUX-mimic能够自然地从失败中恢复:机器人抓取失误后会自动纠正,重新抓取并完成任务。没有任何演示数据集能覆盖任务可能出错的所有情况。从未演示过的恢复能力必须来自别处——来自一个已经理解世界运行方式的模型。

骨干网络预测的未来(上方),以及机器人根据解码动作执行的轨迹(下方)。

足够快,才能行动

实际部署面临一个硬性限制:模型必须与真实世界同步行动。FLUX-mimic的主要计算成本集中在骨干网络。它是模型中最大的组件,在Mimic的优化部署栈中,其延迟实际上决定了整个系统的上限。

这正是我们方法论的第二次回报。更好的表征意味着每个参数蕴含更多能力:一个学习了良好结构世界模型的模型,相比未学习的模型,达到相同性能水平所需的容量更少。在部署中,这直接意味着可以运行更小的骨干网络——而更小的骨干网络就是更快的骨干网络。

在100万训练步数下的CLIP分数;越高越好。骨干网络深度是部署延迟的主要驱动因素,因此层数越少,模型越快。

因此,FLUX-mimic的骨干网络经过优化后,在单张NVIDIA RTX 5090 GPU上从输入到世界表征的推理时间不到80毫秒——这与人类视觉反应时间处于同一量级。

实际部署需要对整个部署栈进行额外优化,以避免增加任何额外延迟:mimic 的优化范围从动作解码器开始,贯穿降低传感器、模型与执行器之间的进程间延迟,直至实现实时分段处理,使预测与执行重叠,确保机器人平稳运行、无抖动。最终效果是一个自包含的机器人系统,反应时间仅为 101 毫秒。

在工厂车间

这一切最终回到自动化真正重要的地方:工厂。奥迪拥有汽车行业自动化程度最高的生产网络之一,这使其能精确看到传统自动化止步于何处。尽管在机器人技术领域投入数十年,涉及柔性部件和精细操作的任务仍依赖人工,这主要出于经济原因:高端生产的品种多样性使得传统编程的机器人工作站针对每种情况重新改造的成本过高。基于学习的系统改变了这一局面。

“与 mimic 合作,奥迪一直在测试和部署 FLUX-mimic。我们看到这些机器人完成了传统机器人根本不可能实现的复杂软体操作。这能在协助员工、提升效率以及扩展生产与物流环节的柔性自动化方面产生重大影响。对我们而言,与 mimic 和 Black Forest Labs 这样的先锋公司合作,是推动物理 AI 前沿、在真实生产环境中验证这些创新的关键。”——奥迪生产实验室 Christoph Schneider

结语

FLUX-mimic 是一款专为机器人设计的模型,也是未来发展的一个佐证。其样本效率与鲁棒性源于 FLUX 3 骨干网络及其暴露出的表征质量,而非特定任务的工程技巧。这正是让该方法能够跨任务、跨行业、跨硬件迁移的原因。更多信息请通过 mimic 了解。

一个以视觉智能为核心、能生成图像、视频和音频,并驱动生产线上机器人的模型。内容创作与物理 AI 是同一基础的两个应用方向。

原始来源: Hacker News

评论 (0)