从一句话到成片:MiniMax H3 完整制作流程(角色三视图→场景图→分镜脚本→逐镜生成)
很多人用 H3 出不了片,不是提示词写得不好,而是把「写提示词」当成了全部。真实的 AI 视频生产是一条流水线:定风格 → 写故事 → 做角色三视图 → 画场景概念图 → 拆分镜脚本 → 逐镜生成 → 剪辑成片。这篇教程把每一步的做法和可照抄的提示词全部给你,并用官方悬疑预告案例做贯穿实例——照着走,你也能从一句话想法做出一支成片。
先看你要做出的成片
这篇教程的贯穿实例,是官方手册里的悬疑预告案例。走完全部七步,你就能做出这样的片子(成片在线播放):
官方成片:《THE STARS WERE LISTENING》悬疑预告(1080p 原片,本篇第七步的最终产物)
全流程一览
① 定风格 → ② 写故事 → ③ 角色三视图 → ④ 场景概念图 → ⑤ 分镜脚本 → ⑥ 逐镜生成 → ⑦ 剪辑成片
前三步是「前期」,决定片子气质;中间两步是「设计」,把故事翻译成模型能执行的指令;最后两步是「生产」,逐镜出片再组装。下面逐步展开。
开始前:入口、积分与素材规格
三个入口按需选:海螺 Web(hailuoai.com,功能最全)/ 海螺 App(手机端,同一账号)/ MiniMax Design(design.minimaxi.com,桌面端有专属权益:新用户 3000 积分 + H3 免费体验 3 次)。开发者走开放平台 API。本篇流程以 Web 端为准。
积分与费用:生成按次消耗积分,新用户有免费额度;每日登录也会补充。注意:任务失败积分可能不退(官方反馈群可申诉)——所以提示词先在文本里打磨好再点生成,别拿积分试错。本篇第五步的分镜脚本就是帮你「生成前想清楚」的。
素材规格速查:单个视频 ≤50MB、图片 ≤30MB、音频 ≤15MB(只限单素材);提示词上限 7000 字符;输出时长 4~15 秒。
比例怎么选:16:9 = B站/视频号/YouTube 横版;9:16 = 抖音/快手竖版;1:1 = 朋友圈/信息流广告;21:9 = 电影宽银幕感;4:3/3:4 = 复古/海报感。用首尾帧模式时比例跟随输入图片的原始比例,所以生图阶段就把比例定对。
第一步:定风格(三件套,不许只写一个词)
风格不是「电影感」三个字,完整的风格定义=三件套:
| 要素 | 回答的问题 | 示例写法 |
|---|---|---|
| 视觉风格 | 画面长什么样 | 写实电影感 / 3D动画伪纪录片 / 复古日系赛璐璐 / 胶片快切时尚广告 |
| 情绪基调 | 观众什么感受 | 60%悬疑+40%爵士的神秘酷感 / 干燥荒诞喜剧 / 温柔怀旧微哀愁 |
| 技术质感 | 摄影和后期规格 | 高反差光影、35mm 胶片颗粒 / VHS 故障+扫描线 / 4K 60fps 干净CG感 |
禁忌:不要堆互相冲突的风格词(「电影、动漫、写实、水彩、赛博朋克」全上=全失)。定一个主风格,补一到两个质感特征就够。整条流水线的每一步(生图、分镜、视频提示词)都复用这三件套,保证全片气质统一。
第二步:写故事大纲(三句话模板)
不用写小说,三句话说清:
【世界】在哪、什么时代、什么规则。
【主角】谁、想要什么、遇到什么阻碍。
【转折】一个具体的画面时刻(能在30秒内演完的高潮)。
然后交给 AI 扩写成 30~60 秒短片大纲,提示词直接用:
你是短片编剧。把下面的想法扩写成一支 30 秒短片的剧情大纲:要求有开场钩子、一个转折、一个余韵结尾;全程「画面可执行」(每个情节点都能被拍出来);不要旁白解说。我的想法:【填入三句话】。风格:【填入三件套】。
实例贯穿:想法是「一个女人面对一扇巨大的门」→ 扩写后:未来世界,一扇巨大圆形宇宙门矗立荒原,女人独自前来探查,门后传来回应,她举起手电——标题浮现《THE STARS WERE LISTENING》。
第三步:角色三视图(跨镜头一致性的命根子)
AI 视频最大的坑是「跨镜头变脸」。解法是先做一张角色设定图(三视图或六视图):同一个角色正面/侧面/背面的全身站立图,作为所有镜头的人物参考。
三视图(正面/侧面/背面)够大多数剧情用;六视图(再加 3/4 侧面、表情包、服装细节)用于主角或系列剧。看官方的实际做法——悬疑预告女主的设定图就是标准三视图+细节特写:

官方案例的角色设定图:全身三视角 + 面部/靴子细节特写(手册1.1 悬疑预告案例输入)
在即梦/Midjourney 等生图工具里,角色设定图的提示词模板:
角色设定图,character sheet,同一个角色的三视图:正面全身、侧面全身、背面全身,站姿标准,纯浅灰背景,均匀柔光,【风格三件套】,【角色描述:性别/年龄/发型发色/服装/配饰/气质】。九头身比例准确,三视图为同一角色同一服装。
要点:①背景必须纯净(后续要做参考图,杂物会干扰);②一次只做一个角色;③角色描述写到「发色+服装材质+标志配饰」颗粒度。多个角色就做多张,一人一张。
第四步:场景概念图(定调性,也是首帧备选)
场景概念图=片子主视觉。它既是生成视频时的场景参考/首帧,也是全片调色的锚。官方悬疑预告的概念图:

官方案例的场景概念图:标题+世界观+色调一张图定完(手册1.1 悬疑预告案例输入)
场景概念图提示词模板:
电影概念艺术图,【主要场景描述:地点/时间/天气/光线】,【风格三件套】,画面中出现【标志元素:门/建筑/道具】,电影构图,留出标题排版空间,【色调:如冷蓝墨绿低饱和】。
有几个重要场景就画几张(一般 2~4 张:主场景+次要场景+高潮场景)。注意每张都带同一套风格三件套。
第五步:分镜脚本(LLM 代劳,给全提示词)
把大纲+素材清单交给 AI 拆分镜,提示词整段复制:
你是视频分镜师。根据下面的剧情大纲,输出一支 30 秒短片的分镜脚本表,Markdown 表格,列=【镜号 | 时长 | 景别 | 画面内容(主体位置+一个动作)| 台词 | 镜头运动 | 环境声】。规则:①总时长控制在30秒;②每镜只安排一个主要动作;③第1镜为超广角建立镜头;④最后一镜留给标题或余韵画面;⑤台词注明说话人。剧情大纲:【粘贴第二步结果】。已有素材:主角三视图1张、场景概念图1张。
产出长这样(官方悬疑预告的实际分镜):镜1 超广角建立:宇宙门占满画面,人物小小背影站在下方偏右,镜头慢推,深低频脉冲;镜2 特写:门中心一片黑暗,标题渐入……拆完手动过一遍:每镜动作是不是只有一个?台词时长和镜头时长是否匹配(口型对不齐多半是这里)?
第六步:逐镜生成(H3 三段式,每镜一条提示词)
进海螺,把角色三视图+场景概念图上传为参考,逐镜生成。每镜一条提示词,套官方三段式:
【参考素材说明】@图片1 是主角人物参考(锁定脸部、发型、服装,不要改变形象);@图片2 是场景与风格参考(锁定色调与光线氛围)。
【核心创意】一位穿黑色长风衣的女人(@图片1)走向荒原上的巨大圆形宇宙门(@图片2),写实电影感,高反差光影,节奏克制,悬疑基调。
【画面过程描述】0-5秒:超广角,巨大宇宙门几乎占满画面,人物只是门前很小的背影,站在画面下方偏右,地面潮湿反光,门中心一片黑暗,镜头缓慢向前推进,深低频脉冲环境声。
规则:①镜1 生成后,如果画面完美,可以把它的末帧截下来当镜2 的关键帧(首尾帧模式),保证镜头衔接;②台词镜头用引号写法「她说:"……"」并确保镜头时长≥台词时长;③人物出场镜头必带 @图片1 人物参考——这就是三视图存在的意义;④一个镜头崩了就单独重roll,不要整片重来。
多角色怎么指代:一张参考图里有多个角色时,必须分别指认,不能笼统写「图中人物」——「@图片1 左侧穿红衣的女性角色」「@图片1 右侧黑衣男性角色」,每个角色的服装/发型特征写进指代里,模型才能分清谁是谁。
镜头衔接的具体操作:镜1 满意后下载视频,用剪映或播放器截取最后一帧存为图片;做镜2 时改用「首尾帧」模式,把这张图设为首帧,再写镜2 的运动描述——两个镜头的画面就能无缝接上。同理做转场时,把镜2 的首帧图也用来反喂镜1 的尾帧。
声音层怎么写:台词、环境声、BGM 三层一次说清
H3 是音画同生的模型——声音和画面一起生成,不需要后期配音。但前提是提示词里把声音写清楚。声音分三层,各管各的:
| 层 | 是什么 | 写在哪 |
|---|---|---|
| 台词层 | 角色说的话/唱的歌 | 画面过程描述里,用引号+说话人 |
| 环境声 | 画面世界里真实存在的声音 | 每个镜头描述的结尾 |
| BGM 层 | 只有观众听见的配乐 | 整段提示词的收尾,单独一句 |
台词层标准写法=说话人+音色+引号台词:
她说:"看那远方的星星。"
进阶写法(指定音色和情绪):「她用疲惫但温柔的女声轻声说:"看那远方的星星。"」。两条铁律:镜头时长必须 ≥ 台词时长(口型对不齐的元凶);台词放引号里,不要转述。
环境声写画面里真实存在的声音,让画面「有质感」:
……镜头缓慢向前推进。Audio: 深低频脉冲,远处金属轻震,地面潮湿的反光声。
常用环境声词库:风声/雨声/室内底噪/脚步声/纸张沙沙/木椅吱呀/衣物摩擦/人群远噪/电流嗡鸣。
BGM 层交代乐器、节奏、情绪、音量变化:
BGM: 中慢速拨弦喜剧配乐,音量克制,在最后一句台词前停顿一拍,结尾一记短促木琴收尾。
三条官方提醒:①不想要 BGM 就整句不提,千万别写「不要背景音乐」——负向指令反而容易触发(官方评论区实锤);②「想用音乐」和「不要 BGM」同时出现=互相矛盾,删一个;③只想要参考某段音频的音色/节奏而不复制原声,上传音频素材并在素材说明里写「@音频1 是音色参考」,不要把原音频的台词带进新片。
复杂音乐需求(完整编曲/热门歌曲)H3 只适合铺底,成片级的音乐轨建议剪映后期叠加——生成时把 BGM 那句删掉,留干净的台词和环境声即可。
第七步:剪映成片
所有镜头下载后进剪映:按分镜表顺序排列 → 卡点转场(悬疑片用硬切,不要叠化)→ 字幕/标题包装(概念图留的排版空间这时候用)→ 音效层(环境声铺底+关键动作一记 hit)→ 调色统一(套同一个 LUT)。成片导出前检查:角色脸是否全片一致、镜头衔接是否跳变、口型是否对上。
合规提醒:AI 生成的视频在抖音/快手/B站等平台发布时,按平台要求添加「AI 生成」内容标识;商用(广告/带货)注意参考素材的版权——用自己拍的或 AI 生成的素材最稳。
新手七个坑(对应七个步骤)
- 风格只写一个词 → 用三件套(视觉+情绪+质感)
- 故事写成小说 → 三句话模板,画面可执行优先
- 跳过三视图直接生成 → 跨镜头必变脸,主角必须先做设定图
- 场景图带杂物 → 纯净背景+明确光线,它还要当首帧
- 分镜一镜塞多动作 → 一镜一动作,复杂事件拆镜头
- 台词比镜头长 → 口型对不齐的元凶,先对齐时长再生成
- 整片一把梭 → 逐镜生成逐镜验,崩了单镜重roll
收尾
这条流水线的前期(风格/故事/三视图/场景图)是一次性投入,越攒越厚——角色设定图和场景概念图留好,做系列剧时直接复用。单点技巧的深度见我们此前篇目:品牌大片五大案例拆解、大字幕 MV 复刻、全参考六段式指南。
海螺工具详情:海螺AI视频 - 奇链产品库。
流程框架与提示词模板为原创整理;贯穿实例与配图取自 MiniMax 官方手册案例(版权归原作者所有)。