AI 数字人口播视频完全教程:一张照片让 TA 开口说话(H3 音画同生)
口播是 AI 视频离钱最近的品类:带货种草、知识科普、本地商家宣传,全是口播的活。这篇讲透用 AI 做「真人感口播视频」的完整流程——海螺 H3 原生音画同生(台词+口型一次生成),不需要真人出镜、不需要录音棚。成片效果先看:
真人口播+实测的种草片(官方案例,H3 类流程可复刻同款质感)
三条制作路径,按需选择
路径 | 做法 | 适合 |
|---|---|---|
照片 + H3 台词口型 | 一张人物照做首帧,台词写进引号,H3 音画同生直接出开口说话的画面 | 快速口播/知识科普/老照片复活式内容 |
Design Agent 全流程 | 一句话需求(产品+人设+平台),Agent 出人设锚图、脚本、分镜、成片 | 电商种草/批量投流(见电商种草篇) |
实拍口播 + AI 精修 | 真人实拍口播,AI 做背景替换/字幕/调色 | 有真人 IP 的账号 |
本篇主讲第一条(零门槛),其余路径的入口知识在文末。
① 定人设:口播的「风格三件套」
要素 | 示例 |
|---|---|
形象 | 年轻短发女性、韩系、米色毛衣(写具体到能生成锚图) |
人设气质 | 松弛日常记录博主 / 干练知识博主 / 热情探店达人 |
场景与景别 | 客厅沙发前 / 书房书架前;胸像景别(口播最稳) |
② 写口播稿:钩子-内容-行动 三段
15 秒口播稿的字数控制在 60~80 字(中文语速约 4~5 字/秒)。模板:
【钩子 3 秒】养猫家庭的地面清洁,真的让人头大。
【内容 8 秒】这款扫地机的防缠毛滚刷,猫毛一吸就走,猫砂碎屑也能处理干净,自动集尘不用管。
【行动 4 秒】养猫的姐妹可以冲,链接放下面了。
先在文本里把稿子改顺(生成前改文案,别生成后改视频),再进下一步。
③ 人物形象锚图
生图工具生成人物照(或用真人照片),要求:正面、胸像、光线均匀、表情自然。提示词模板:
写实人像,【形象描述:年龄/发型/服装】,坐在【场景】前,面向镜头自然微笑,柔和室内光,背景轻微虚化,胸像构图,真实摄影质感,9:16
这张图就是人物身份锚图——之后所有口播镜头都用它,保证跨视频同脸。
④ 生成口播视频:台词写法(关键)
海螺(H3 模型):上传锚图 → 图生视频 → 台词写进提示词的引号里:
画面中的女生面向镜头自然地说话,她说:"养猫家庭的地面清洁,真的让人头大。这款扫地机防缠毛滚刷,猫毛一吸就走。"表情随语句自然变化,头部轻微动作,镜头固定,室内光稳定
三条铁律:①镜头时长 ≥ 台词朗读时长(口型对不齐的元凶);②一次生成别塞超过两句台词,长稿拆多条生成;③结尾保持人物在画面中静止半秒,方便剪辑。
⑤ 剪映收尾
多条口播按稿子顺序拼接 → 自动识别字幕(口播片字幕必加,一半观众静音刷)→ BGM 音量压低到人声的 20% → 封面用「开口微笑」帧。
避坑清单
口型对不上 → 镜头时长对齐台词;台词改短而不是加速
换镜头变脸 → 全部镜头用同一张锚图做参考,人设描述不改
手势诡异 → 口播镜头提示词写「头部轻微动作」,手势留到实拍或后期贴纸
眼神飘 → 写「直视镜头」,胸像景别最稳
发布合规 → 平台打「AI 生成」标识;数字人形象别用真人肖像(侵权红线)
练手作业
选一个你熟悉的产品,写 15 秒口播稿 → 生成人物锚图 → 用 H3 台词模式出三条口播镜头 → 剪映拼条加字幕。走完这一轮,口播视频的产线就是你的了。