← 文章 / AI视频与短剧
Lightricks官方 2小时前 · 2026-08-30 10:18:03 · 4 阅读

ComfyUI 跑 LTX-2.5 完整教程:文生视频、图生视频、首尾帧三条工作流

ComfyUI 已经原生支持 LTX-2.5,官方模板库里直接给了文生视频、图生视频、首尾帧三条工作流,模型用 int8 量化版(int8-convrot)压显存,是当前本地跑 LTX-2.5 最省心的方式。这篇按"下载模型 → 打开模板 → 三条工作流逐个跑通"的顺序走一遍,全程有文件清单和提示词可抄。

提示词怎么写不在本篇展开,先读:LTX-2.5 提示词写作指南;整体流程定位见总纲 从一句话到成片

准备工作:三件事

1. 更新 ComfyUI 到最新版。LTX-2.5 节点在新版里才有,报"缺节点"基本就是版本旧了,桌面版直接升级,手动部署的拉最新 main(官方文档建议 nightly)。

2. 申请 Hugging Face 权限。权重在 gated 仓库 Lightricks/LTX-2.5:登录 HF → 打开仓库页 → 同意协议提交申请(一般很快通过)→ 生成一个带 read 权限的 token。下载报 401/403,九成是这步没完成。

3. 显存预期。官方对开源版给的参考是 16GB 显存起步,ComfyUI 模板用的 int8-convrot 量化版已经压了一档;再往下可以关掉空间放大阶段、缩短帧数试试。没有合适显卡就走 API 或官方 Playground。

第一步:下载模型文件(清单照抄)

全部来自 HF 仓库 Lightricks/LTX-2.5(enhancer 除外),按目录放好:

文件放到说明
ltx-2.5-22b-distilled-transformer-comfy-int8-convrot.safetensorsmodels/diffusion_models/主模型,必装
gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrot.safetensorsmodels/text_encoders/文本编码器,必装
ltx-2.5-video-vae-bf16.safetensorsmodels/vae/视频 VAE,必装
ltx-2.5-audio-vae-bf16.safetensorsmodels/vae/音频 VAE,必装(没有它就没声音)
ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensorsmodels/latent_upscale_models/二倍空间放大,T2V/I2V 用(FLF2V 不用)
gemma4_e2b_it_int8_convrot.safetensorsmodels/text_encoders/可选,仅 prompt_enhance 用,约 5GB(Comfy-Org/gemma-4 仓库)

注意文本编码器必须用这个 LTX 定制微调版(gemma4-12b-with-proj-ltx-2.5),不能用 Google 原版 Gemma 4 顶替,模型会做版本校验。

第二步:打开官方模板

ComfyUI 界面里依次打开 模板库(Template Library)→ Video → LTX-2.5,能看到三条工作流:文生视频(T2V)、图生视频(I2V)、首尾帧(FLF2V)。点开后按弹窗引导下载模型(或手动按上表放置),加载完就能跑。三条工作流的骨架是一致的:加载模型 → 文本编码 → 采样 → 视频/音频双 VAE 解码 → 保存,差别只在入口是文字还是图片。

工作流一:文生视频(T2V)

提示词按"一段话讲戏"写满五要素——镜头、场景、动作、角色、运镜,再加声音。模板默认带二倍空间放大阶段,嫌慢可以绕开。节点上的 prompt_enhance 开关默认关闭,打开后会用本地增强模型帮你扩写提示词,但要多花 1–2 分钟和那颗可选的 5GB 增强模型。

Aerial shot slowly rising over Arctic pack ice. A polar bear stands on a drifting floe, turning its head toward the camera. Cold wind and distant cracking ice. White title text "LTX-2.5" fades in over the scene. Cinematic, soft overcast light.

官方模板默认提示词就是上面这条的思路——注意它连画面中的标题文字都写进去了,LTX-2.5 对画面文字的渲染是强项:

ComfyUI 官方 T2V 模板示例输出:北极熊场景 + 画面内标题文字(视频来自 ComfyUI 官方模板库)

工作流二:图生视频(I2V)

把你的图接入 Load Image 节点作为首帧,提示词只描述图之后发生的事,并加上官方锚定句。示例输入图与成片:

图1 输入首帧:城市夜景楼顶视角

图1:输入首帧(官方示例输入,即成片的起始画面)

Use the provided start image as the first frame. The camera drifts forward over the city as neon signs flicker to life, light trails streak across the wet streets below. Traffic hum and distant sirens, subtle synth pad.

ComfyUI 官方 I2V 模板示例输出:由首帧延展的城市夜景运镜(视频来自 ComfyUI 官方模板库)

图生视频的更多通用技巧(选图、动作幅度控制)见原创篇 图生视频怎么做

工作流三:首尾帧(FLF2V)

接两张图:首帧 + 尾帧,宽高比必须一致,提示词写中间的过渡过程。这条工作流没有空间放大阶段,速度更快。官方示例是一张机械手"充能"前后对比:

图2 首帧:机械手合拢未充能图3 尾帧:能量核心点亮

图2/图3:首帧与尾帧(取自官方 FLF2V 示例成片首尾画面)

Use the provided start image as the first frame and the provided end image as the last frame. The robotic hand slowly clenches as energy gathers in the palm, arcs of electricity crackle and intensify. Low electric hum rising in pitch.

ComfyUI 官方 FLF2V 模板示例输出:机械手能量汇聚过渡(视频来自 ComfyUI 官方模板库)

首尾帧的进阶玩法与坑位清单见 首尾帧视频生成技巧

常见问题

  • 提示缺节点:ComfyUI 版本太旧,升级到最新(官方文档建议 nightly)即可。
  • 模型下载 401/403:gated 仓库协议没同意,或 token 没有 read 权限,回 HF 仓库页补流程。
  • 显存不够:模板默认 int8 量化模型已经省一档;还可以缩短帧数、关掉空间放大阶段;再不行上 fp8/卸载方案(见命令行篇)或走 API。
  • 生成的片子没声音:检查音频 VAE(ltx-2.5-audio-vae-bf16)有没有装、音频解码支路有没有接上。
  • 开了 prompt_enhance 变慢:正常的,官方标注会多花 1–2 分钟,不用它就保持关闭。

下一步

想在命令行里把这个模型跑进自动化流水线、或者解锁 DFR 高保真与 4K HDR 输出,看系列进阶篇:LTX-2 命令行生成教程。系列总览与授权说明在 开源视频模型 LTX-2.5 上手指南

站内产品页:LTX-2(开源音视频模型)LTX Studio(AI 影视创作工作台)

本文流程与示例整理自 ComfyUI 官方文档(docs.comfy.org/tutorials/video/ltx/ltx-2-5),示例视频与输入图取自 ComfyUI 官方模板库,仅供学习演示,版权归原作者所有;步骤拆解与 FAQ 为原创整理。

原始来源: Lightricks官方

评论 (0)