模型再强,为什么 Demo 还是进不了生产?
随着模型能力越来越强,真正卡住业务落地的,往往已经不是“模型行不行”,而是它能否稳定运行一万次、被不同团队复用,并持续产出可衡量的结果。
9 月 12 日,在 Lance 开发者沙龙(Lance Meetup)上海站现场,火山引擎数智平台算法工程师 曾骞 以 LAS 多模态算子体系 为例,并结合 具身智能、电商素材 和 视频投流 三个规模化场景案例,分享了火山引擎 LAS 如何用一套多模态算子体系,把已经足够强的模型能力,真正搬进企业的生产系统。

以下内容摘自演讲实录。
模型会做,不等于业务能用

当模型已经能理解和生成文本、图片、音频、视频,为什么不少能力仍停留在演示阶段?
因为业务要的不是“偶尔做对一次”,而是成千上万次稳定运行。在真实系统中,输入格式可能不统一,长视频可能超出上下文窗口,生成结果会波动,任务失败后还要能定位、重试和控制成本。这些问题单独看都很琐碎,却共同决定了模型能否进入生产。
我们把“可用”分成三个台阶
能力可用,是一次调用成功;
生产可用,是链路能稳定交付;
规模可用,是同一套能力可以跨业务复用,底层模型升级时,上层系统不必整体重写。
这段从模型能力到业务交付的距离,就是生产化的“最后一公里”:把不确定的模型输出,变成可交付、可复用的业务产出。
生产化最后一公里的“三条鸿沟”

仅靠大模型或 Agent 自身,很难稳定、低成本地完成数据的解析、清洗与应用。规模化生产的关键瓶颈,可以归纳为三道鸿沟:
第一道是 模型能力鸿沟。大模型存在输入规格限制、长视频理解效果差、视频生成抽卡成功率低等瓶颈。一整段长视频无法被整段理解或生成,需要抽帧、分镜、音轨分离和语义压缩;一份复杂 PDF 要恢复标题、表格、公式、页码与图文关系,也不是调一次大模型就能解决。
第二道是 工程链路鸿沟。真实的数据处理往往同时涉及 CPU 预处理、GPU 推理、规则校验、存储与任务管理。如果每来一个新场景,都要重新写一遍连接上下游的代码,上线周期和维护成本就很难降下来。
第三道是 效果确定性鸿沟。视频生成存在随机性,有时一条可用素材需要反复尝试。只返回一次生成结果,无法满足批量交付的要求,还必须把输入校验、自动评估、定向修复、重试和人工确认纳入处理过程。
这也是我们对“最后一公里”的理解:通过模型之外的生产化工程,把不确定的模型输出变成可以交付、可以复用的业务产出。
LAS 的思路,是把这些差异和限制封装进算子:输入前做校验和预处理,执行中记录参数与状态,输出后自动评估;发现局部问题时定向修复,而不是整条任务从头再跑。
什么是生产级算子:四层全景与 150+ 算子矩阵
目前,LAS 已沉淀 150 多个算子,覆盖视频、音频、文本、文档、图像五类模态,支撑具身智能、智能驾驶、电商营销、广告制作等多个场景。
LAS 的算子服务全景可以理解为四层:
最上层是门店质检、金融研报解析、具身智能预训练、高光剪辑、电商素材、广告生成和出海等应用场景。
服务层提供三种入口:用于批量处理的 API、供 Agent 调用的 CLI/Skills,以及实时交互的 Studio WebUI,三种形态共享同一套能力。
再向下是算子矩阵。视频类覆盖理解、剪辑、生成、修复和切分;音频类包含转写、切分、语种识别和降噪,其中 ASR 支持 99 种语种;文本与文档链路可进行 176 种语种识别,并支持结构化解析与语义切分;图像类负责生成、裁剪和质量评分。
底层则是数据集管理、计算队列、监控告警、安全和计费。四层解耦后,上游业务不必感知模型差异,下游系统可以稳定消费结果。
但算子的数量并不是目标。一个被多个业务反复调用的算子,比一批躺在文档里、没有人使用的算子更有价值。真正决定复用率的,是稳定的契约和实际的处理效果。

所谓契约,就是业务系统可以依赖的一套明确约定:输入什么、输出什么、怎么调用、失败如何处理,以及结果怎样才算合格。我们称之为生产级算子的“三个统一”:
统一输入输出:每个算子都要明确输入介质、文件限制、参数、输出结构、状态和错误含义。比如,视频分镜算子输出镜头、人物、场景、道具与时间线;训练数据处理算子输出可追溯的数据集版本和质量结果。上游不必反复适配模型差异,下游也能稳定消费处理结果。
统一调用协议:短任务采用同步调用,长视频、批量文档和生成任务采用异步协议。任务需要有可追踪的 ID、明确的状态、幂等语义和失败原因,支持重试及历史版本保留,同时兼顾在线低延迟交互与离线批量处理。
统一质量规范:接入 API、让任务跑起来还不够。如果结果不能用,前面的投入就没有转化成交付。输入端要校验格式、尺寸、时长与内容可用性,处理过程中要记录模型、参数、版本和中间结果,输出端再由规则、模型评估或人工审核判断是否合格。
因此,算子不只是模型接口的包装。它是一份稳定契约,把模型能力、前后处理、资源调度和质量要求组合成可复用的生产单元。
工作流编排,把业务策略写进链路

有了完善的算子体系,还要让它们在业务系统里真正运行起来。工作流编排的作用,是把业务目标、质量标准和异常处理策略写进处理链路。
评估结果决定下一步:达到标准就直接返回;未达标但可以修复,就定位问题片段、调整参数并局部重试;品牌、安全、合规等场景无法自动判断时,则进入人工确认。人审结论会继续反哺评估标准,逐步减少重复审核。
这种编排也在优化算力。格式转换、切分、抽帧和文本清洗由 CPU 承担,生成、理解和增强交给 GPU。系统按节点分配资源、控制并发、拆分批次,让昂贵算力集中在真正需要推理的环节。按分享中的不同统计口径,LAS 以 AI Native 分布式计算引擎支撑批量并发,单算子支持千级别高并发处理。并发数字之外,更重要的是失败可定位、任务可恢复、成本可约束。
三个实战案例,看到规模化如何发生
具身智能训练数据处理:Ego 视频进 Lance,VLA 模型直读训练
训练数据处理是典型的高吞吐、长周期、多模态混合任务。数据量大、环节多,失败和返工的代价也高,因此,它很能检验算子体系是否真正“生产可用”。
原始数据如何变成训练资产,离不开四层底座共同发力:
最上层 应用层 面向预训练语料、多模态理解、视频生成、语音与音频、图文文档等训练场景。
标准算子层 提供文本清洗去重、视频理解与生成、语音处理、文档解析、语义切分、质量评估、检测估计、语种识别、图像处理等算子。
计算编排层 负责批量任务提交、CPU 与 GPU 分级调度、并发与批次拆分、失败重试与恢复、数据集版本管理、血缘与运行记录。
最底层的 数据资产层 则由 Lance 承载,做到图文与向量同表、增量标签列与版本回溯、零拷贝随机读与训练直读。

在具身智能场景中,算子先把第一视角或多相机 Ego 视频加工为 Caption、事件状态、动作时序、目标轨迹等结构化标注;Lance 再把视频、标注和向量放进同一张表,通过增量列、版本回溯和训练直读,把标注结果变成可持续迭代的训练资产。标注结果还会经过一致性和置信度评分;低置信度与疑难样本进入人工复核,形成“预标注→复核→二检→回流”的人机协同闭环。
在该场景实践口径下,核心标注任务准确率达到 90%以上,标注与交付周期由月级缩短到周级。
电商爆款素材复刻:复用结构,而不是像素

这里的“爆款”指短视频平台上跑出来的爆款视频:从历史爆款中提取镜头结构、构图、话术节奏与转场逻辑,保留叙事骨架,同时替换商品、人物与背景,快速生成多 SKU、多平台、多账号的差异化投放版本。
整条链路分为六步:一是 爆款解构,用视频精细理解与分镜算子识别主体、构图、镜头顺序、卖点表达与节奏,抽取可迁移的结构化脚本;二是 Prompt 生成,把碎片化创意转成适配视频模型的结构化指令,或直接给出可用于生成的分镜脚本;三是素材配对,把源视频与多张商品图、人物图、背景图建立批量任务矩阵,一次配置生成多个版本;四是生成与编辑,通过视频编辑增强做主体、人物、背景替换,输出不同比例、分辨率与平台规格,或直接从分镜脚本生成视频;五是评估与修复,对替换边界、时序一致性与画面质量做全量质检,不合格结果按问题类型自动改写参数重试;六是版本与投放,保留候选版本、质量标签与运行记录,合格素材直接进入投放与效果回流。
随着这套链路落地,素材生产效率提升 100 倍以上,人工成本降低 80% 以上,抽卡成功率提升 50%以上。
比数字的变化更重要的是组织方式的变化——团队里的每个人都从重复劳动中解放出来,变成“策略师”,精力重新回到选品、创意与投放分析上。她用一句话总结这个案例:真正被复制的不是像素,而是爆款的结构化表达;真正提升产能的不是一次生成,而是“解构、生成、评估、修复、投放”的完整闭环。
视频投流:让长内容贯通生成与分发

视频投流的难点不在单条镜头好不好,而在于成百上千条素材中,能否稳定筛出真正能带来转化的高光片段,并快速产出多语言、多平台的版本。
LAS 将内容生产、高光提取、投流素材生成和出海本地化串进同一条链路:先完成重绘、分镜、拼接和配音,再识别情绪高点、冲突点与剧情钩子,按平台时长和画幅批量生成版本,最后完成转写、翻译、字幕与多语言分发。
这套流程可带来 10 倍以上的单集生产效率提升,单条素材进入分钟级生成,投流素材成功率提升 50%以上,并支持 30 多种语言,可灵活适配多种出海需求。
模型+算子+编排 = 规模化

这是我们在过去两年实践中形成的一个体会:再强的模型,如果每接入一个业务系统都需要重新编写适配代码,就很难沉淀为组织能够持续复用的资产。
模型提供能力,算子提供业务系统可以依赖的稳定契约,编排则把校验、评估、重试和人工确认等策略落实到链路中。三者结合,才能支撑持续的规模化生产。
规模化也不能只凭“感觉更快了”来判断。要看一次通过率和返工率,看批量处理下的有效产能,也要看单位可用产出的成本,以及端到端交付周期是否真正改善。
一条效果很好的生成结果,不等于稳定的批量产能;单次调用价格降低,也不等于每条可用素材的成本降低。反复重试、整条重新生成和人工返工,都应算进真实的生产成本。
从“能力可用”走向“生产可用”,需要的是一套可以持续复用、组合、度量和演进的算子体系。让每一次模型进步,都能更快、更稳、更低成本地转化为业务价值,这就是 LAS 多模态算子体系希望解决的问题。