入门 约 25 分钟 2026-09-07 10:09:05 · 26 阅读

HeyGen 双人对话视频实操:Avatar Shots 同屏、多场景交替与 API 三条路

两个人坐下来对话的数字人视频,HeyGen 给了三条路

产品问答、双语播客、虚拟访谈——这类「两个人你一句我一句」的视频,在 HeyGen 里现在有三种做法:Avatar Shots 让两个数字人同屏出现在一个画面里说话;Studio 多场景让两个人轮流出镜,剪成一来一回;API 则把整段对话用代码拼成一条片子。这篇教程依据 HeyGen 官方博客《How to Make Two Avatars Talk in HeyGen》和帮助中心《Avatar Shots》指南整理,把三条路各自的入口、点击路径、提示词写法和积分代价拆开讲清楚,官方示例提示词原文照抄,换掉人名和台词就能套用。它属于AI 视频教程系列里数字人方向的一篇,HeyGen 的平台档案见产品页

动手前先算清这笔账

Avatar Shots 是三个方法里唯一能让两个数字人同时出现在画面里的,但它有明确的门槛,官方文档写得比较细,先把影响决策的几件事列出来。

套餐方面,帮助中心原文说明:This feature is available for all paid HeyGen plans——所有付费套餐可用,免费档不行。还有一条容易踩的时间线:2026 年 8 月 17 日之后购买的 Creator 套餐,在 Avatar Shots、Cinematic mode、Video Agent 和 B roll generation 这几个功能里拿不到 Seedance2 引擎(功能本身还在,改用其他引擎渲染)。如果你正好在那之后续费,生成效果会和早先教程里的演示有差别。

积分方面,官方明码标价:720p 一条 60 积分,1080p 一条 150 积分,5 秒、10 秒、15 秒同价——也就是说拍一条 15 秒的 720p 对话视频,成本就是 60 积分,不会因为时长变长而多扣。4K 目前在 HeyGen 内的 Seedance2 上不支持。积分消耗的具体数字以官方页面为准,官方也表示「希望尽快降低这个成本」。

数字人素材方面有个限制要提前知道:Avatar Shots 目前只支持视频录制的真人 look(video-based real-human looks),一个卡槽通常只能选一个 look,官方说「更多 look 选择快了」。想同框的两个人,得先各自有合规的视频数字人。

路线一:Avatar Shots,两个人同屏

找到入口

帮助中心给了两条路径:从 HeyGen 主界面点左上角的 Avatar 标签,在菜单里选 Avatar Shots(带 🆕 角标);或者从新的 HeyGen lobby 进入 Avatar Shots / Seedance2。生成的成品统一存在 Avatar Shots 专区里,不在主 Projects 页——第一次用找不到片子别慌,去专区看。

下面这张官方指南截图是 Seedance2 引擎的创作界面,模型选择器、提示词输入框和底部一排参数都在一个面板上,Avatar Shots 的操作就发生在这样的界面里:

HeyGen AI Video Generator 界面

HeyGen 官方指南截图:Seedance2 引擎创作界面,含模型选择、提示词面板与时长/分辨率/画幅设置

第一步:把两个人放进提示词区

选中的数字人会以缩略图形式出现在提示词输入区。点缩略图旁的 + 按钮往同一条视频里加人,上限 3 个;点某个缩略图右上角的灰色 X 可以把人移除。两个人的时候各占一个卡槽,系统据此知道画面里有谁。

第二步:写提示词,说清谁先开口

官方博客对 Avatar Shots 提示词的要求是:像写导演阐述(director's brief)一样,越具体越好。一段合格的提示词要覆盖四样东西——场景与氛围(例如 neon-lit Tokyo street at night, rain, cinematic)、两个人在做什么(two presenters facing each other in a debate)、镜头怎么动(slow push-in to close-up)、以及声音什么样。最后一条尤其重要:Avatar Shots 不能单独上传音频,想要什么声音只能在提示词里描述,比如 epic orchestral score、ambient city sounds。

对话视频最关键的是说话顺序。博客原文的写法是:identify the first speaker, describe what happens when that person finishes, and then direct the second avatar to respond——先点名谁先说,描述他说完之后发生什么,再指示第二个人接话。把这段逻辑翻译成提示词,就是「A 开场介绍产品,说完停顿一拍,B 摇头反驳」这种句式。

帮助中心还放了一个完整的趣味示例,原文照抄,感受一下它的具体程度:

Make the guy here become Super Saiyan in a very cool and dramatic way — lightning crackling around him, golden aura, epic orchestral music building to a peak.

Avatar Shots 官方示例提示词(帮助中心《Avatar Shots》一文)

镜头语言部分,帮助中心的建议是按分镜结构写,Seedance2 处理多镜头提示词的能力很强。官方给的模板原文:

Start wide on both presenters → cut to close-up of left avatar → pull back to full scene.

官方「分镜式」镜头提示词模板(帮助中心)

用短语而不是长句想镜头:slow dolly-in、crane shot overhead、tracking shot from the right 这类术语,引擎跟得很稳。实在拿不准怎么写,可以先用 AI 助手把模糊想法改写成结构化提示词——官方指南自己也是这么教的:

官方提示词改写示例

官方指南配图:把「模糊想法」改写成分镜化提示词的完整示例,结尾按 Camera / Lighting / Mood / Style 分字段

第三步:可选,挂参考素材

想让视频锁定某种背景风格、道具、色板或整体气质,可以上传图片或视频做参考。素材来源有两个:之前在 HeyGen 里生成过的资产,或者从设备直接上传的文件。参考不是必选项,但对品牌向内容很有用。

第四步:定时长和画幅

提示词面板底部有一排控制项。时长三档:5 秒、10 秒、15 秒,15 秒是当前上限;画幅两档:Portrait 竖屏或 Landscape 横屏。另有一个 Enhance 开关,官方说明是「如果发现可以优化,会自动改进你的提示词」。

这一排参数的样子(加号入口挂参考素材的位置也有蓝色标注):

参考素材与参数设置

官方指南截图:Add References 入口(蓝色标注处)与 Avatar / Location / Camera / Music、时长、分辨率、画幅等参数

第五步:点箭头生成,且生成即定稿

对提示词和参数满意后,点输入框的向上箭头 开始生成。这里有一条官方用感叹号强调的规则:No edits after generation——点击生成的那一刻积分立即扣除,成片不能做任何修改,哪怕只是调一个音效、改一处细节。不满意只能改提示词重新生成一条。官方因此提醒:需要精确逐场景控制的创作者,用 HeyGen Studio 走路线二,别在 Avatar Shots 里反复试错烧积分。

生成效果可以看官方放在帮助中心的这段演示动图,两个数字人在同一画面里完成动作与对话:

Avatar Shots 官方演示

Avatar Shots 官方演示动图(帮助中心原文配图):同屏多数字人生成效果

路线二:Studio 多场景,两个人轮流说

如果不需要两个人同框,只要干净的交替对话,多场景结构更省事。博客的思路是把台词按说话人拆开:开场场景放第一个数字人和台词的前半段;第二个场景放另一个数字人的回应;如此交替直到对话结束;最后按顺序检查一遍,确认台词衔接没有乱序。场景连续播放时,观感就是两个人在对话。

这个做法有个额外好处,博客原文点明了:每个说话轮次独立成场景,谁在说话一目了然(every speaking turn has its own scene),不会出现两个人抢话的模糊地带。代价是没有同屏画面——全程是「说话的人独占镜头」的切换感,更像新闻连线而不是面对面访谈。

路线三:用 API 把对话拼成一条片子

要做批量或者接进自家系统,就走 API。开发者文档说明:鉴权用 X-Api-Key 请求头,密钥在 Settings → API 里创建;对话视频用 type: "studio" 的请求体,场景写进 scenes 数组,每个场景指定自己的数字人和台词,按说话顺序排列。两个 avatar_video 场景交替,就是一条双人对话。下面这个最小示例按官方文档的字段拼成,两景一来一回:

curl -X POST "https://api.heygen.com/v3/videos" \
  -H "x-api-key: YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "type": "studio",
    "scenes": [
      {
        "type": "avatar_video",
        "input": {
          "type": "avatar",
          "avatar_id": "AVATAR_A",
          "script": "开场台词,由第一个数字人说出",
          "voice_id": "VOICE_A"
        }
      },
      {
        "type": "avatar_video",
        "input": {
          "type": "avatar",
          "avatar_id": "AVATAR_B",
          "script": "回应台词,由第二个数字人说出",
          "voice_id": "VOICE_B"
        }
      }
    ]
  }'

生成是异步的:请求返回一个 video_id,轮询 GET /v3/videos/{video_id} 直到 status 变成 completed 就能拿到下载地址;不想轮询可以在请求里加 callback_url 走 webhook。另外两点官方写明的规则:type 为 avatar 的单场景请求渲染一个场景,台词或音频最长 30 分钟,更长就拆成多个场景组成 studio 视频;渲染是 all-or-nothing——一个请求产出一条视频,任何一个场景失败则整条不产出。

三条路怎么选

官方博客在 Which approach should you use 一节给了判断标准,直接抄结论:两个人必须同屏出现,选 Avatar Shots,提示词里写清谁先说、谁接话;要干净利落的交替对话而不在乎同屏,选多场景,把台词按说话人拆给对应场景;对话要进自动化流程、批量产出,选 API,把场景按顺序提交。对多数零基础用户,答案是第一条:Avatar Shots 上手最快,一条提示词就有同屏对话效果,只要守住「生成前把提示词磨好」这一个习惯,积分就花在刀刃上。

官方明示的限制,逐条过

帮助中心专门列了 Current Limitations 一节,做决定前值得逐条对照:视频最长 15 秒;每条视频最多 3 个数字人;音频不能上传,只能在提示词里描述;生成后不能编辑,任何修改都要重新生成;成片存在 Avatar Shots 专区而非主 Projects 页;语言方面,英语、汉语(含部分方言)、西班牙语、日语、韩语、印尼语为稳定语言,法语、意大利语、土耳其语「也能用,但最好找母语者核一下」。这些限制官方更新得比较勤,动手前以帮助中心原文为准。

来源

本文步骤与图片依据 HeyGen 官方博客《How to Make Two Avatars Talk in HeyGen》、帮助中心《Avatar Shots - Powered by Seedance2》及开发者文档 Studio 一节整理,示例提示词与限制清单为官方原文,版权归原作者所有。

评论 (0)