LTX-2.5 提示词写作指南:像讲戏一样写提示词(附 8 个可抄模板)
换了新模型,提示词就要换写法。LTX-2.5 官方提示词指南开篇就纠正了一个普遍误区:它要的不是关键词堆砌,而是一段"讲给摄影师听"的完整描述——像导演讲戏一样,把镜头、场景、动作、光线和声音说成一段流畅的话。这篇把官方指南的写作框架、声音设计写法和多镜头写法整理成可以直接照抄的模板。
提示词是七步流水线里贯穿始终的基本功,还不熟悉整体流程的先看总纲:从一句话到成片:MiniMax H3 完整制作流程。
总原则:一段话讲戏,不是罗列标签
LTX-2.5 的文本编码器对自然语言的理解远好于逗号分隔的标签串。官方建议用一个流畅的段落把五件事说清楚:
- 镜头语言:景别(特写/中景/远景)+ 运镜(缓慢推近/手持跟拍/环绕)
- 场景:地点、时间、天气、环境氛围
- 主体与动作:谁、在做什么、动作的节奏和幅度
- 风格与光线:电影感/纪录片/动画,光线方向与色调
- 声音:台词、环境声、音乐——想到什么写什么,模型会和画面一起生成
写得越具体,模型可发挥的"猜测空间"越小,成片越贴你的意图。这也是为什么同样的模型,有人出片惊艳有人出片平平——差距基本都在提示词的信息密度上。下面这条官方能力演示,就是"提示词写到位"的效果:
官方提示词遵循能力演示:舞台灯光、乐器细节、演奏节奏全部来自文字描述(视频取自 ltx.io)
声音设计:台词、环境声、音乐三层直接写进提示词
LTX-2.5 最大的不同是声音不用后期配。总纲第⑥步讲过"声音三层"写法,在 LTX-2.5 上就是直接写进同一段提示词:
台词:角色"说"的内容放在引号里,并写清说话时的状态。例如:他压低声音对镜头说:"我们只有一次机会。"(引号里的内容会被直接生成成台词并驱动口型)
环境声:明确写出场景里该有的声音。例如:雨点砸在铁皮屋顶上,远处有雷声,房间里传来老式风扇的嗡嗡声。
音乐:写风格和情绪,不写具体歌名。例如:背景是轻快的爵士鼓点,随剧情推进逐渐增强。
官方还强调了 audio-to-motion 机制:音频特征会直接驱动角色动作、镜头运动和场景动态——写清节奏和能量,画面会跟着声音的律动走。
图生视频:只描述"图之后"发生的事
用一张图做首帧时,新手最容易犯的错是把图里已有的内容再描述一遍。官方要求:提示词只写图片时刻之后发生的动作、镜头变化和声音,并用一句锚定语告诉模型首帧来自这张图:
Use the provided start image as the first frame. 她缓缓抬起头,看向窗外的城市,晨光逐渐变亮。镜头缓慢环绕到她的侧面。环境里只有键盘敲击声和窗外的车流声。
首句英文锚定语是官方文档给的写法,后接中文描述在 LTX 上同样可用;保险起见也可以整段写英文。更多图生视频的通用经验见我们的原创篇:图生视频怎么做。
首尾帧:描述"怎么从 A 到 B"
给首帧和尾帧两张图时,提示词的任务是描述中间的过渡过程——镜头怎么运动、主体怎么变化、中间发生什么事件。注意两张图的宽高比必须一致。示例(过渡过程描述):
Use the provided start image as the first frame and the provided end image as the last frame. 机械手掌缓缓合拢,掌心的能量核心逐渐亮起并凝聚成光球,粒子向四周飘散。镜头从手背缓慢环绕到掌心特写。
首尾帧工作流的完整跟做在 ComfyUI 教程篇;通用玩法拆解见 首尾帧视频生成技巧。
多镜头:一次生成,按顺序讲完所有镜头
多镜头是 LTX-2.5 的招牌能力。写法要点:在同一段提示词里按时间顺序描述每个镜头,明确标记切换的位置,并且每个镜头都重复关键设定(角色外观、服装、光线风格),模型会在切换处保持人物、环境与声音的连贯:
一段双镜头短片。镜头一(远景):黄昏的戈壁公路上,一辆红色皮卡由远及近扬起沙尘,镜头缓慢横移跟随;风声与引擎声由弱变强。切入镜头二(车内中景):留寸头、穿米色风衣的女司机目视前方,对副驾说:"天黑前必须到检查站。"车内收音机放着老歌,窗外光线持续变暗。
关键设定在两个镜头里都出现了(皮卡、黄昏光线、人物着装),切换点用"切入镜头二"明确标出——这是官方指南的核心思路。看官方演示的效果:
官方多镜头演示:一次生成内完成风格统一的连续镜头切换(视频取自 ltx.io)
正误清单
| ✅ 这样写 | ❌ 别这样写 |
|---|---|
| 一段流畅的段落,镜头→场景→动作→声音 | "电影感,8K,大师之作,获奖作品"式的标签串 |
| 具体动作:"他猛地转身,撞翻了椅子" | 抽象形容:"他非常生气,情绪激动" |
| 声音明确写出:台词引号、环境声、音乐风格 | 只写画面,成片变成哑剧再回头配 |
| 图生视频只写"图之后"的变化 | 把首帧图里已有的内容重新描述一遍 |
| 多镜头按顺序写、切换点标清楚、设定重复出现 | 所有镜头挤在一句话里,切换全靠模型猜 |
把提示词从 60 分写到 90 分,最直观的回报就是画面质量与可控性——官方"更强的结果"演示:
官方画质演示:室内剧情场景的表演、光线与氛围(视频取自 ltx.io)
可抄模板库(按官方框架整理,改括号内容即用)
【电影感人物台词】特写镜头,缓慢推近。深夜的便利店,暖白灯光下,穿灰色连帽衫的年轻人(外貌细节)盯着柜台,低声说:"(台词)。"冰柜的嗡嗡声和窗外的雨声持续,背景音乐是低沉的钢琴单音。
【动作追逐】手持跟拍,中景。雨夜的窄巷里,穿黑色皮夹克的信使骑摩托车急转弯,溅起水花,镜头剧烈晃动跟随。轮胎摩擦声、雨水拍打声、远处警笛交织,配紧张的电子节拍。
【自然纪录片】航拍俯瞰,缓慢下降。清晨的火山熔岩原野,橘红色岩浆在黑色地表上缓缓流动冒烟,热浪扭曲空气。只有低沉的隆隆声和偶尔的爆裂声,旁白式配乐克制悠长。
【美食广告】微距特写,浅景深。铁板上正在煎制的牛排滋滋作响,油花溅起,镜头缓慢环绕,蒸汽在逆光中升起。重点收录煎烤的滋滋声,背景是轻快的原声吉他。
【MV 现场】中近景,手持轻微晃动。昏暗的livehouse舞台,逆光中长发吉他手低头扫弦,鼓点密集,镜头随节奏轻微跳动。观众欢呼声、贝斯低频与主干音轨混合,副歌处镜头快速推向琴头。
【多镜头叙事】一段双镜头短片。镜头一(远景):(环境+主体出场+环境声)。切入镜头二(近景):(同一主体外观复述+台词+音乐)。
【图生视频】Use the provided start image as the first frame. (只写后续动作)镜头(运镜),主体(新动作),(环境声与音乐)。
【首尾帧】Use the provided start image as the first frame and the provided end image as the last frame. (描述从首帧到尾帧的过渡过程:主体变化+镜头运动+声音)
下一步
提示词写好了,去哪生成?三条路径任选:ComfyUI 本地工作流、命令行 ltx-pipelines,或官方在线 Playground。模型全貌见系列总览:开源视频模型 LTX-2.5 上手指南。
站内产品页:LTX-2(开源音视频模型) | LTX Studio(AI 影视创作工作台)
本文整理自 Lightricks 官方提示词指南(ltx.io/blog/prompting-guide-for-ltx-2)与 ComfyUI 官方文档的 LTX-2.5 章节,演示视频取自 ltx.io,仅供学习演示,版权归原作者所有;模板与拆解为原创整理,可自由改写使用。