海螺 MiniMax H3 提示词怎么写?全参考模式六段式结构完全指南
📚 配套阅读:《从一句话到成片:H3 完整制作流程》(角色三视图→场景图→分镜→逐镜生成全流程提示词)
海螺的 MiniMax H3 是目前国产视频模型里「全参考」能力最强的一档:角色图、场景图、动作视频、声音参考可以一起丢进去,让模型拼装出一条完整成片。但很多人上手就翻车——因为 H3 的提示词不是「写作文」,而是写一份结构严格的视频制作说明书,格式错了,素材再好也出不了片。
这篇指南把 H3 官方提示词规范拆开讲透:六段式结构、四种素材标签、六种任务类型、镜头级写法和台词规范,文末附可直接套用的完整模板。

先搞清一个核心区别
同样是多素材参考,各家模型的路数不一样:即梦背后是 Seedance 2.0,用 @ 素材的方式指定来源(我们在即梦入门教程里讲过);H3 的做法是让你把提示词写成一份六段式结构化说明书,明确规定每份素材提供什么、保留什么、在哪个镜头生效。
还有一个硬性要求:提示词主体必须用英文写。只有角色台词、歌词和画面中真实出现的文字可以保留原语言。英文不熟练不要紧,先按格式写中文再让 AI 翻译,或者直接把文末模板丢给 AI 仿写替换元素。
核心原则:写「可执行的画面」,不是「剧情梗概」
「一个女孩在咖啡馆遇到一只狗」——这是故事,模型没法执行。合格的镜头描述长这样:
中景,女孩坐在画面右侧的橙色沙发上,右手拿着饼干。年轻男人从画面左侧进入,牵着一只白色萨摩耶。狗突然向饼干靠近,牵引绳被拉直,女孩迅速将手向后收。
区别在于:后者交代了景别构图、人物位置、外观、单一动作、状态变化和镜头关系。一句话总结 H3 全参考提示词的底层逻辑——不要告诉模型你上传了什么文件,要告诉模型每份素材负责什么,以及它应该在成片的哪个镜头中如何生效。
六段式结构:提示词的骨架
H3 全参考模式的完整提示词由六个部分组成,顺序固定:
| 段落 | 作用 |
|---|---|
| subject_definitions | 定义参考素材中需要被单独识别和追踪的内容(人物/物体/场景/动作等) |
| summary | 开头用方括号标明任务类型,再用一小段话说明生成什么、各素材承担什么作用 |
| retention_analysis | 声明哪些特征必须完整保留、哪些允许修改、哪些只是弱参考 |
| detailed_description | 主体部分:按播放顺序逐镜头写画面、动作、镜头、声音和台词 |
| overall_soundscape | 画面世界里真实存在的环境声(风声/脚步/室内底噪) |
| non_diegetic_music | 只有观众听得见的背景配乐 |
四种素材标签:最关键的技巧
给参考内容正确贴标签,是 H3 全参考模式的核心。四种标签,N 从 1 开始编号:
<SubjectN>:真正出现在成片里的内容
Subject 不是「文件」,是从文件中提取出来要在成片里使用的视觉元素——人物、动物、物体、场景、服装、道具、动作、表情都算。写法示例:
<Subject1> is the young wolf demon in <Picture1>, with grey fur, drooping ears, worn brown clothes, and a nervous expression.
一张图可以提供多个 Subject(一张咖啡馆照片既能提取「女孩」也能提取「咖啡馆环境」);同一个 Subject 也可以来自多份素材——这是 H3 最实用的能力:
<Subject1> is the woman whose appearance comes from <Picture1> and whose walking motion comes from <Video1>.
长相来自图片,走路动作来自视频,拼装到同一个角色身上。
<PictureN>:具体画面锚点
只有当图片要担任首帧、尾帧、关键帧、构图参考、分镜图、被编辑画面时才单独定义为 Picture。只提供人物长相的图不需要——写进 Subject 定义就行。最常见错误就是传了五张图就机械地写五个 Picture。
<VideoN>:整段视频的结构来源
Video 管的是整段视频与目标视频的关系:修改原片、续写、参考运镜/剪辑节奏/镜头顺序。如果只想用视频里某个人的动作,那个动作应该定义成 Subject 而不是 Video。
<AudioN>:声音素材
负责复制声音或参考音色、节奏、情绪、音乐风格。视频自带声音不等于必须定义 Audio,只有声音真的要被用才写。Video 和 Audio 各自独立编号。
六种任务类型:summary 的开头必须写
summary 开头用方括号标明任务类型,可组合使用:
- [keyframe completion]:参考图直接当首帧/尾帧/关键帧
- [reference generation]:参考人物/场景/风格/动作/声音特征但不改原片——普通多素材生成最常用
- [video editing]:直接修改一段已有视频
- [video continuation]:从原视频结尾继续生成
- [audio reuse]:原样复制原音频
- [audio reference]:只参考音色/节奏/语气,不复制原声
组合示例:[video continuation + keyframe completion + audio reference]。注意:只是参考视频的运镜或节奏,仍属 reference generation,不要误写成 video editing。
保留程度:四种关系告诉模型什么不能改
retention_analysis 段落里,视觉素材用四种关系:
| 关系 | 含义 | 典型场景 |
|---|---|---|
| fully_preserved | 完整保留 | 角色不能变脸、服装/场景布局/首尾帧严格一致 |
| partially_preserved | 保留一部分允许修改 | 保持人物身份但换服装、保持场景但改光线 |
| attribute_transfer | 属性转移给别的对象 | 把参考视频里成年人的动作转移给小狼妖 |
| weak_reference | 只求大致相似 | 只参考氛围/画风/构图/节奏 |
音频素材对应四档:fully_copy(完整复制)、partially_copy(复制部分)、reference(只参考音色节奏)、weak_reference(只保持氛围)。
detailed_description:真正决定效果的部分
官方建议生成类任务写到约 350~500 个英文单词,但不要机械凑字数。三个要点:
1. 先定风格——风格句放在第一个镜头之前,确定一个主风格再加一到两个质感特征,不要堆冲突词:
The target video uses a stylized 3D animated mockumentary style, with slightly exaggerated expressions, warm daylight, and dry absurdist comedy.
2. 镜头用时间戳编号——第一个镜头 [Shot1] 不写时间,后续标明开始时间:
[Shot2] At 00:03.000, ... | [Shot3] At 00:06.500, ...
3. 每个镜头按固定七步写:景别构图 → 人物位置 → 人物外观(首次出现时重申关键特征)→ 单一动作 → 表情状态变化(写可见变化如 "his ears droop slightly",不要只写「紧张」)→ 镜头运动 → 声音与台词。一个镜头只安排一个主要动作,复杂事件拆成多个镜头——这是所有视频模型通用的稳妥做法。
台词的标准写法
每个真实发声的角色都要有说话者编号 (S1)(S2)(S3),按首次发声顺序确定且不能变。完整格式:
<Subject1> (S1) says in a nervous young male voice, <d>[Chinese] 我有三封推荐信,两封是我自己写的。</d>
<Subject1> 是画面角色,(S1) 是声音来源,[Chinese] 标注台词语言,<d>...</d> 包裹台词。规则:台词保留原语言不翻译;听不清写 [unclear] 不要猜;画外音写 speaking off-screen;只参考音色时别把参考音频的原台词带进新视频。
环境声和背景音乐必须分开
overall_soundscape 写画面世界里真实存在的声音(风、脚步、衣物摩擦、室内底噪);non_diegetic_music 写只有观众能听见的配乐,最好交代乐器、速度、情绪、音量变化(如「笑点前停顿」)。台词只放在 detailed_description 里,不要在这两段重复。
八个高频错误,对照自查
- 把所有参考图都定义成 Picture——只提供外观特征的图应写 Subject
- 把参考视频里的人物写成 Video——人物/物体/动作是 Subject,Video 管整段结构
- 只写「参考某张图」——要写清参考那张图的什么(脸部特征?服装?构图?)
- 一份素材承担太多模糊任务——拆开:动作来自 Video1、节奏弱参考、场景来自 Picture2
- 只写剧情不写画面——「他参加了一次面试」无法执行,要写站位、动作、镜头、台词
- 一个镜头塞太多动作——一镜一动作,拆镜头解决
- 角色声音编号中途变化——(S1) 定了就贯穿全片
- 混淆复制声音和参考声音——保留原音轨用 audio reuse,只要音色用 audio reference
完整模板(新手直接套用)
subject_definitions:
<Subject1> is [人物/动物/物体/场景], whose [外观/服装/身份特征] come from <Picture1>.
<Subject2> is [第二个视觉主体], whose [动作/表情/外观] come from <Video1>.
<Picture2> is the [first frame / keyframe / composition reference] of [ShotN].
<Video1> is the source video used as a reference for [camera movement / editing rhythm / temporal structure].
<Audio1> is the voice-timbre reference for <Subject1> (S1).
summary:
[reference generation + audio reference] The target video shows [人物、场景和核心事件]. <Picture2> defines [画面作用]. <Video1> provides [视频参考作用]. <Audio1> provides [声音参考作用].
retention_analysis:
<Subject1> (appears in [Shot1], [Shot2]): fully_preserved [必须保留的特征].
<Subject2> (appears in [Shot2], [Shot3]): partially_preserved [保留什么,允许改什么].
<Video1> (camera movement and pacing): weak_reference [大致参考的内容].
<Audio1>: reference [只参考音色情绪节奏,不复制原声].
detailed_description:
The target video uses a [主风格] with [光线、色彩、质感].
[Shot1] A [景别] shows [环境与构图]. <Subject1>, [关键外观], stands at [画面位置]. [一个主要动作]. The camera [运镜]. [环境声].
[Shot2] At 00:03.000, the shot cuts to [景别] of <Subject2>. [位置/动作/状态变化]. <Subject1> (S1) says in a [音色/情绪/速度], <d>[Chinese] 台词。</d>
[Shot3] At 00:06.000, the shot cuts to [新构图]. [一个主要动作]. <Subject2> (S2) replies in a [声音描述], <d>[Chinese] 台词。</d> The camera [运镜或静止]. The shot ends on [末帧状态].
overall_soundscape:
[环境底噪、脚步、衣物摩擦等现实声音].
non_diegetic_music:
[乐器、节奏、情绪、音量变化].
一个完整的官方风格示例:小狼妖面试
假设上传四份素材:Picture1 小狼妖角色图、Picture2 花果山招聘大厅、Video1 求职者紧张递简历的动作视频、Audio1 小狼妖声音参考。要点串起来看:
- Subject 定义了小狼妖(长相来自 Picture1)、猴面试官、招聘大厅环境(来自 Picture2)、以及「紧张的递材料动作」(从 Video1 提取,attribute_transfer 给小狼妖)
- summary 标注 [reference generation + audio reference]
- retention_analysis 里三个视觉主体 fully_preserved,动作 attribute_transfer,声音只 reference 音色
- detailed_description 三镜头:Shot1 中全景建立大厅+递简历,Shot2 特写面试官问「有大圣的推荐信吗?」,Shot3 特写小狼妖答「没有,但我能吃苦」+面试官把简历推回「我们这里不缺苦,缺关系」
- 声景是招聘大厅低噪+纸张声+木椅声;配乐是「中慢速拨弦喜剧配乐,面试官最后一句话前停顿」
这就是一份合格的 H3 说明书:每份素材有标签、有保留等级、有生效镜头,台词编号清晰,声音分层明确。
五步写法,收尾
面对任何复杂参考素材,别急着写长提示词,先走五步:拆素材(每份素材提供什么)→ 定标签(Subject/Picture/Video/Audio)→ 定保留程度(四档关系)→ 拆镜头(按播放顺序拆成单动作镜头)→ 补声音(台词/环境声/配乐三层分开)。
H3 目前确实必须遵守这套格式才容易出好片,嫌麻烦的话实操建议是:把上面的完整模板直接丢给 AI,让它按你的素材仿写,再逐项替换元素,比从零写快得多。
海螺工具详情见:海螺AI视频 - 奇链产品库;即梦的 @ 素材用法见《即梦AI文生视频入门教程》。
本文整理改编自微信公众号「动画大丸家」的教程《别瞎抽卡!MiniMax H3 提示词有严格格式,一文拿捏!》(2026-08-05),原始内容版权归原作者所有,转载请注明出处。