LTX-2.5 官方 ComfyUI 工作流实操:拉模板、配参数、蒸馏版与完整版怎么选
想在自己显卡上跑带声音的视频模型,官方模板已经铺好路
云端视频模型按秒烧钱,本地部署又常被依赖冲突劝退。LTX-2.5 的做法是把三条官方 ComfyUI 模板直接内置进 ComfyUI 的模板库——文生视频、图生视频、首尾帧——打开 Templates 搜一下就能把模型文件拉齐,连视频和音频各自需要的 VAE 都一起下载。这篇教程依据 LTX 官方博客《LTX-2.5 Image-to-Video & Text-to-Video Workflow Guide》整理,把三条模板的适用场景、蒸馏版与完整版的参数差异(这是最容易浪费渲染时间的地方)、提示词写法和官方示例原文讲清楚。它是AI 视频教程系列里本地部署方向的一篇,LTX-2 的平台档案见产品页。
开工前的两件事
硬件门槛先说死:官方给本地安装教程的基线是 16GB 显存起步(跑小分辨率视频),32GB 或更多才宽裕。低于这条线的机器,官方建议改用 LTX Desktop 或云端 API,别硬上。软件侧只需要装好 ComfyUI 本体(桌面版从 comfy.org/download 下载),LTX 的节点装好后模板会自动出现在模板库里。
三条模板各管一件事:图生视频(I2V)把静图动起来,带运动、镜头和同步音频;文生视频(T2V)纯靠提示词出片;首尾帧(FLF)给起点图和终点图,生成中间的运动。I2V 和 T2V 是两段式(低分辨率打底再放大),FLF 是单段式、没有放大环节。
拉模板:三个动作
打开 ComfyUI,点 Templates,搜索 LTX-2.5,按 Download all。这一步会把每条模板需要的模型文件都拉下来,包括出声必需的视频 VAE 和音频 VAE——LTX-2.5 的画面和声音用两个独立的 VAE 解码,只要生成带声音的视频,两个文件都不能少。整套工作流的样子:

官方教程图:LTX-2.5 图生视频模板的完整节点工作流,Step 1 到放大输出全链路
加载模型:认准这几个加载器
模板把组件分成七块加载:LTX-2.5 transformer(UNETLoader 放 models/diffusion_models/)、Gemma 文本编码器(CLIPLoader,type 选 ltxv)、可选的提示词增强器(同样走 CLIPLoader)、视频 VAE、音频 VAE、负责 2 倍放大的空间上采样器(放 models/latent_upscale_models/)。官方教程截图里 Step 1 分组里四个加载器一字排开:

官方教程图:Step 1 - Load Model 分组,蒸馏版 transformer、上采样器、文本编码器与音频 VAE 各就各位
视频参数:三条硬校验规则
分辨率、帧数、帧率三个参数各有官方写明的约束,配错直接跑不动或时长不对。帧数必须是「8 的倍数加 1」:模板默认 97 帧,24fps 下约 4 秒;121 帧约 5 秒。宽高必须能被 32 整除——所以 720、1080 这类标签数字不能直接填;模板默认 768x512。帧率默认 24fps,模型最高支持到 50fps,且必须与 Create Video 节点里的帧率一致,否则音画会错位。还有一条要心里有数:两段式模板最后会 2 倍放大,768x512 的底实际输出 1536x1024,设参数时按「想要的一半」来填。参数面板长这样:

官方教程图:Step 2 - Video Size 分组,宽高、帧数(121)、帧率(24.0)与整数帧率转换节点
提示词:写「发生了什么」,不是「画面长什么样」
官方对 LTX-2.5 提示词的要求很具体:结构化的长提示词,覆盖视觉风格、角色外观与动作、镜头运动、对白或旁白、背景音乐或音效;说出来的台词要放进引号里。图生视频有个关键差别——模型已经从图里看到了画面,提示词该写「发生了什么」而不是描述场景。单条提示词还能用显式剪辑(cuts)串起多个镜头,官方给的适用范围是每次生成 2 到 4 个镜头,角色、场景和声音能跨镜头保持。官方教程里放了两段完整示例,原文照抄。第一段是多镜头加对白的动画场景:
a 3d animated movie scene shows the wise elderly owl on the left saying to a baby owl to his right, with a raspy deep voice: "focus, close your eyes, and flap!". we then see the little owl jump off the branch screaming in fear and disappear. the the elder owl remains standing on the branch with a disappointed face. the camera remains static in place
官方教程示例提示词一:猫头鹰动画场景(原文含重复的 "the the",照抄自官方配图)
第二段是电影感场景,注意它怎么写镜头位置(固定在火车侧面)、怎么嵌对白、怎么点环境音:
cinematic drama movie scene shows a closeup of a blonde woman wearing a red sweater hanging out of the open door of a moving train, looking outside and smiling. the camera is fixed to the train's side as the train moves forward on the track. the woman seems excited and says: "I think we're almost there!". we hear the train's engine in the background. then, a little boy with brown hair pops his head out of the train along with the woman, looking at her in excitement. he then asks her: "This is Nana's old village, isn't it?". she nodes and embraces him joyfully.
官方教程示例提示词二:火车温情场景(原文 "she nodes" 为官方笔误,照抄)

官方教程图:Positive Prompt 节点中的猫头鹰场景提示词实例
提示词默认会先过一遍 Prompt Enhancer(提示词增强器)再进文本编码器,官方用的是 Gemma 系列增强模型。改增强器的 seed 会得到不同的扩写版本;当你在精修某个具体镜头时,官方建议直接把 Prompt Enhance 关掉,用你自己的原文,避免每次扩写不一样导致结果漂移。文生视频因为没有参考图,提示词的详细程度权重更大——官方原话是 longer, more descriptive prompts consistently produce better T2V results。

官方教程图:火车场景提示词在 Positive Prompt 节点中的实际填法
蒸馏版还是完整版:CFG 是分水岭
官方表格把两条路线的差异列得很清楚。蒸馏版(distilled):基础检查点叠加蒸馏 LoRA,第一阶段 8 步,采样器 euler_ancestral 加双 CFG 引导器,CFG 固定在 1(实验也别超 1.5)——引导已经烘焙进蒸馏过程,调高只会白烧算力不会变好;第二阶段 2 倍空间放大加 4 步精修。完整版(full):蒸馏 LoRA 降强度,第一阶段 15 步、RES4LYF 的 res_2s 二阶采样器(约等于 30 有效步),音频和视频各有独立引导器,CFG 3.0 到 3.5 是甜点区(可用范围 2.0 到 5.0),越高提示词服从性越强、过高会出现脏纹理;需要额外装 RES4LYF 节点。官方推荐的工作节奏:平时用蒸馏版快速迭代,定稿了切完整版出最终渲染。
多尺度渲染与省显存技巧
LTX-2.5 的多尺度架构等于内置了放大流程:先出低分辨率底,再用空间上采样器放大 2 倍并在全分辨率上精修。图生视频模板里,源图在第一阶段以部分强度注入做条件(留出运动空间),第二阶段以全强度重新注入保住细节。音频和视频走「拼接-采样-拆分-解码-合并」:空的音频 latent 和视频 latent 拼在一起采样(这是音画同步的来源),再拆开分别解码——视频走分块 VAE 解码(tiled decoding),音频走音频 VAE,最后合成单个文件。解码阶段爆显存的话,官方给的办法是提高 tile 数量。低显存机器还有个官方推荐的节奏:固定随机 seed,先只出低分辨率预览看运动和音画对不对,满意了再跑放大段,中间不满意改了再来,放大那一下的算力别浪费。
LoRA:强度区间和匹配纪律
想改风格、运动或角色,加 LoraLoader 节点即可。官方给的强度刻度:效果类 LoRA 从 1.0 起步——0.9 到 1.1 是微调,1.2 到 1.4 是大多数场景的平衡区,1.5 到 1.6 是风格迁移上限;多个 LoRA 叠加时总强度控制在 2.0 以内;IC-LoRA 控制适配器按设计就该全强度,固定 1.0。匹配规则官方也写了:用别的 LTX 代次训练的 LoRA 能跑但可能掉质量,上生产前先确认适配器的训练对象。结构控制、修复、创意变换这类进阶玩法,仓库的 example_workflows/2.5/ 目录里带了 IC-LoRA 控制和内绘/外绘工作流;自己训 LoRA 用 LTX Trainer(在 LTX-2 的 GitHub 仓库里,支持 LoRA、IC-LoRA 和全量微调)。加载节点这样接:

官方教程图:LoRA 分组,两个 LoraLoaderModelOnly 节点串联,lora_name 与 strength_model=1.00
官方最佳实践清单,逐条抄给你
写长提示词、把音频要求写进去;所有节点的帧率保持一致避免失同步;先低分辨率预览再放大省时间省显存;蒸馏路线 CFG 设 1、完整版 4 上下;解码爆内存就加 tile 数。开发节奏上:蒸馏版迭代、完整版出成品、对比变体时固定随机 seed、镜头运动在提示词里显式描述。这套清单来自官方 Best Practices 一节,属于官方反复验证过的默认值,照抄不会错。
来源
本文步骤与图片依据 LTX 官方博客《LTX-2.5 Image-to-Video & Text-to-Video Workflow Guide》(Rachel Luxemburg,2026-01-29)整理,示例提示词、参数约束与强度区间为官方原文,版权归原作者所有。
本篇用到的工具