入门 约 20 分钟 2026-09-02 05:16:18 · 16 阅读

Vidu 多主体参考生视频教程:@一下,让角色在所有镜头里都是同一张脸

写在前面的成果预告

读完并跟着做,你会得到两样东西:一是能独立用 Vidu「参考生视频」做出多镜头角色不换脸的 AI 视频——同一个角色出现在吧台、街道、特写里,长相、服装、气质始终如一;二是学会用官方 API 把这套能力接进自己的程序,实现批量生产。本文全步骤依据 Vidu 官网功能页与官方 API 文档(2026-09 抓取)整理,每一步都告诉你点哪里、填什么、应该看到什么。如果你是刚入坑 AI 视频的新手,建议先读一遍总纲 《从一句话到成片:AI 视频完整制作流程》建立全局观,再回来跟本篇实操;本文对应的产品页在 dbyun Vidu 专区

一、先搞懂:参考生视频和图生视频,到底差在哪

很多新手第一反应是"我都知道图生视频了,为什么还要参考生视频?"一句话说清:图生视频让"一张图"动起来,参考生视频让"一组角色/场景"在多个镜头里保持一致。官方对两者的定位区分非常明确,对照下表选择:

核心用例:参考生视频面向跨多个镜头、以一致性为核心的视频生成;图生视频用于让单张图片或首尾帧动起来。
输入类型:参考生视频吃参考视频或多组参考(图片、视频、提示词);图生视频只吃单张图片或关键帧。
一致性:参考生视频强,能保持角色身份与场景连贯;图生视频有限,并非为多场景一致性设计。
适合场景:前者是故事叙述、广告、AI 虚拟人物、多镜头工作流;后者是快速内容、产品动图、社媒短片。

判断标准就一条:你的视频里,同一个角色或产品要不要出现两次以上?要,就用参考生视频。比如三集连续剧同一个主角、十支广告同一个产品、上下镜头同一个场景——这些任务用图生视频做,每次生成角色都会"重新投胎",参考生视频就是官方给这个痛点的解法。

二、动手前:把参考图准备好

参考生视频的输入是 1~7 张参考图片(网页版与 API 规则一致)。参考图质量直接决定成片一致性,准备时守住三条纪律:

第一,一个主体至少一张"干净"的图。角色图最好是纯色背景或简单场景下的单人清晰照,脸部无遮挡、光线均匀。官方说明每个参考可以提取来源图片或视频中的角色、风格、构图、镜头运动、场景以及特效等信息——反过来说,图里杂质越多,提取出来的"主体"越不纯。

第二,按"一主体一图"组织素材。想做"男主角走进酒吧,女招待端来红酒"这种双人戏,就准备男主角一张、女主角一张、酒吧场景一张,共三张参考图,而不是把三人塞进一张合影。分开给,模型才知道谁是独立主体。

第三,格式与规格检查。图片支持 png、jpeg、jpg、webp 格式;像素不能小于 128×128;比例需要在 1:4 到 4:1 之间(别用极端长条图);文件大小不超过 50MB。这些是官方 API 文档写死的硬限制,网页版同样适用。

没有素材的新手可以直接用 AI 生图先造角色三视图(总纲教程 9447 里有完整方法),或者从 Vidu 的素材库中直接选用现成参考——官方步骤原文明确写有"可以使用自己的图片,也可以从素材库中直接选用"。

进阶技巧:一个主体可以挂多张图。官方 API 的 subjects 参数允许每个主体最多上传 3 张图——给同一个角色配"正面 + 侧面 + 全身"三张,一致性通常比单图更稳,因为模型能从多角度理解这个主体长什么样。注意所有主体的图片加起来仍要落在 1~7 张的总额度内,主体较多时优先把名额留给主角和核心场景。

三、网页版实操:从进入官网到下载成片

官方把整个流程概括为三步:选择「参考生视频」→ 输入提示词 → 生成并下载。下面按实际界面逐步拆开。

第 1 步:进入功能入口

打开 Vidu 官网(国际站 vidu.com 或中国站 vidu.cn),注册/登录后进入创作台。点击顶部导航的「参考生视频」(创作台内入口名称为 character2video)。你应该看到:一个上传区域和一个提示词输入框,输入框附近有模型、时长、画面比例等参数选择区。

第一步:选择参考生视频功能

官方教程图 1:选择「参考生视频」,上传 1–7 张参考图(官方文档截图)

第 2 步:上传参考图

把准备好的参考图拖进上传区域(或点击上传按钮逐张选择)。按第二步的纪律,双人戏就传"男主一张 + 女主一张 + 场景一张"。上传后应该看到每张图生成一个缩略图卡片——这些卡片就是你稍后在提示词里要用 @ 引用的"主体"。上传顺序就是主体编号顺序:第一张是 @图1(或你命名的主体名),第二张是 @图2,以此类推。传错可以删除单张重传,不用全部推倒。

第 3 步:写提示词并用 @ 锁定主体

这是全流程最核心的一步。参考生视频的提示词语法有一个专属武器——@主体。在输入框里描述画面时,用 @ 加主体名来点名"谁"做"什么事"。官方文档给出的标准示例是:

@1 和 @2 在一起吃火锅,并且旁白音说火锅大家都爱吃。

官网首页的演示案例也是同样的写法——上传一张牛仔角色图和一张酒吧场景图,提示词写成"@ 牛仔 坐在吧台前":"一位 @女郎 拿着一瓶红酒走向他",再补一句"镜头向前推进..."。@符号就是"一致性锚点":被点名的主体在整段视频里保持同一张脸。

提示词的组织顺序建议:谁(@主体)+ 在哪(场景/@场景主体)+ 做什么(动作)+ 镜头怎么动(推拉摇移)+ 声音(台词/旁白/音效)。主体调用的提示词上限是 5000 字符,足够把戏写细。

第二步:输入提示词

官方教程图 2:在输入框描述角色动作,设置分辨率与画面比例(官方文档截图)

第 4 步:设置参数

输入框附近的参数区,按需确认四项:

时长:viduq3 系模型默认 5 秒,可选 3~16 秒——Q3 是"音画同出"的新一代模型,单次最长可生成 16 秒完整片段;画面比例:默认 16:9(横屏),做竖屏短视频改 9:16,方形内容选 1:1;分辨率:默认 720p,可选 540p、720p、1080p,正式出片建议 1080p;声音:viduq3 与 viduq3-turbo 默认开启音视频直出,可选音频类型 all(音效+人声)、speech_only(仅人声)、sound_effect_only(仅音效)。

各参数的完整取值范围以官方页面为准,平台更新很快,本节只列 API 文档当前写明的值。

第 5 步:点击生成,等待完成

点击 Create(创作)按钮提交任务。提交后页面会出现任务卡片,状态依次经过排队中、生成中,最后变为完成——官方 API 文档定义的完整状态机是 created(创建成功)→ queueing(排队)→ processing(处理中)→ success(成功)/failed(失败)。5~16 秒的任务通常几分钟内完成,期间可以另开任务并行抽卡。

第三步:生成并下载

官方教程图 3:生成完成后先预览,确认无误再下载(官方文档截图)

第 6 步:预览与下载

任务完成后先点开预览:重点检查角色脸有没有漂、场景道具有没有穿帮、音画是否同步。满意再点下载保存到本地;不满意就调整提示词或更换参考图重新生成。提醒一句:抽卡是 AI 视频的正常工作方式,同一段提示词跑两三次挑最好的一条,是所有熟练用户的日常。

官方牛仔案例:@牛仔坐在吧台前

官网演示案例:同一牛仔角色跨镜头保持一致(官方页面截图)

四、直接可抄的多主体提示词模板

把上面的写法沉淀成三个模板,替换方括号内容即可用:

【双人互动】@角色A 和 @角色B 在[场景描述]里[具体动作],镜头[运镜方式],[音效/台词说明]。

【角色+场景+产品】@角色 在 @场景 中拿起 @产品,镜头缓缓推近,突出[产品卖点],背景音乐轻快。

【多镜头叙事】@牛仔 坐在吧台前。一位 @女郎 拿着一瓶红酒走向他。镜头向前推进,爵士乐渐起。

第三个模板就是官网首页演示案例的原文结构,多个短句各管一个镜头,@锚点贯穿始终,这是参考生视频区别于普通文生视频的写法精髓:普通提示词堆形容词,参考生提示词像导演讲戏——点名、调度、说戏。

五、进阶:用 API 把流程自动化

网页版适合单条创作,批量生产(比如一个 10 镜短剧)就该走 API 路线。整个过程分四步:拿 Key → 创建任务 → 轮询结果 → 下载成片。

第 1 步:获取 API Key

打开 Vidu 开放平台 platform.vidu.cn,注册并进入控制台,在 API Key 管理页创建一个 Key 并妥善保存。API 文档规定的鉴权方式是请求头携带 Authorization: Token {your api key}

第 2 步:创建参考生视频任务

官方端点是 POST https://api.vidu.cn/ent/v2/reference2video。下面是按官方文档示例改写的多主体调用(subjects 方式,主体在请求里显式命名):

curl -X POST "https://api.vidu.cn/ent/v2/reference2video" \
  -H "Content-Type: application/json" \
  -H "Authorization: Token $VIDU_API_KEY" \
  -d '{
    "model": "viduq3",
    "subjects": [
      { "name": "牛仔", "images": ["https://你的图床/牛仔.png"] },
      { "name": "酒吧", "images": ["https://你的图床/酒吧.png"] }
    ],
    "prompt": "@牛仔 坐在吧台前,一位陌生人推门而入,镜头缓缓推进,环境音有轻爵士乐。",
    "duration": 8,
    "aspect_ratio": "16:9",
    "resolution": "1080p"
  }'

发出去应该看到返回体里有 task_idstate: "created",同时给出本次调用消耗的 credits 积分数。

主体怎么组织?文档里给了两条路线。上面示例是临时主体:name、图片都写在本次请求里,用完即走,适合一次性任务。如果某个角色要反复用(比如系列短剧的主角),就走主体库模式:先通过官方「创建主体」接口把角色注册进主体库,拿到 server_id(主体 id),之后每次生成只需在 subjects 里带上 name 和 server_id,不必重复传图。此外还有一个 auto_subjects 开关,设为 true 可启用智能主体库能力,让系统自动处理主体匹配。

主体数量也有讲究。官方规则:使用 q3、q2、q1、2.0 模型时,只能用图片主体和文字主体,最多不超过 7 个;使用 viduq2-pro 模型时可以额外使用视频主体(最多 2 个),但图片/文字主体上限降为 4 个。多角色群戏建议控制在 3~5 个主体,名额越多,每个主体分到的"注意力"越少。

不用 subjects 的非主体调用更简单:直接把 1~7 张图塞进 images 数组(官方示例用 3 张图 + 提示词 "Santa Claus and the bear hug by the lakeside."),适合"这一组图合起来出一条视频"的场景。注意非主体调用的提示词上限是 2000 字符,比主体调用的 5000 短。

模型怎么选?官方文档的定位说明:viduq3-mix 画面质感强、均衡性最强(但暂不支持 subjects 主体调用);viduq3 多机位一致性更出色;viduq3-turbo 生成速度最快、性价比最高;viduq2-pro 支持参考视频与视频编辑;viduq2 动态效果好;viduq1 运镜稳定。追一致性选 q3 系,追便宜快速选 turbo。

第 3 步:轮询任务结果

任务异步执行,用官方查询接口轮询:

curl "https://api.vidu.cn/ent/v2/tasks/你的task_id/creations" \
  -H "Authorization: Token $VIDU_API_KEY"

返回的 state 变成 success 后,creations 数组里就是成片:url 是视频地址、cover_url 是封面、watermarked_url 是带"内容由AI生成"水印的版本。特别注意:这些 URL 有效期只有 24 小时,拿到结果要立刻下载转存到自己的存储,这是官方文档写明的硬规则,也是新手最容易踩的坑。

第 4 步(可选):错峰与水印设置

追求省钱可加 "off_peak": true 走错峰模式——积分消耗更低,任务在 48 小时内完成,未完成的自动取消并返还积分;赶时间的即时任务保持默认 false。对外发布的内容建议加官方水印:"watermark": true,默认位置右下角,可通过 wm_position 调整(1 左上、2 右上、3 右下、4 左下)。积分具体价格以平台价格页实时显示为准。

多参考支持:最多 7 个参考素材

官方功能页:多参考支持,最多 7 个参考素材协同生成(官方页面截图)

六、常见坑排查

坑 1:角色还是"变脸"或换装。先检查参考图:主体图是否干净、是否一主体一图;再检查提示词:被要求的动作是否让角色面目变化(大特写+剧烈运动最容易漂)。官方 FAQ 给出的方法一致——为每个角色建立清晰的参考主体,并在提示词中标注关键动作与重点信息

跨镜头保持视觉一致性

官方功能页:维持画面与故事的视觉连贯性(官方页面截图)

坑 2:物体中途消失或变形。物件没有独立参考时最容易发生。给关键道具单独一张参考图,并在提示词里明确它的位置与状态。

坑 3:API 返回 failed。按官方错误码表排查,高频原因是:图片规格越线(小于 128×128、超过 50MB、极端比例)、Key 无效或积分不足、viduq3-mix 模型误用了 subjects 主体参数(该模型暂不支持主体调用)。

坑 4:成片链接第二天失效。生成物 URL 有效期 24 小时,务必当天下载转存;网页版下载的本地文件不受影响。

坑 5:想要背景音乐却发现没生效。bgm 参数在 q3 系模型中不生效(q3 走音视频直出,自带音效与台词),在 q2 系 9/10 秒时长下也不生效——音乐需求交给 q3 的音画同出或后期配音。

坑 6:任务一直排队不出片。先看状态:queueing(排队)是高峰期的正常现象,耐心等待即可;如果走的是错峰模式(off_peak),官方规则是任务在 48 小时内生成,未能完成的会被自动取消并返还积分,所以错峰任务适合"不急要片"的场景,赶进度请用即时任务。

七、来源与延伸阅读

本文步骤、参数与图片依据 Vidu 官网参考生视频功能页与官方 API 文档(platform.vidu.cn)整理,版权归原作者所有;参数取值以官方页面实时显示为准。想继续进阶,推荐配合站内总纲 《从一句话到成片:MiniMax H3 完整制作流程》学习"角色三视图→场景图→分镜脚本→逐镜生成"的完整产线——那条产线里的"逐镜生成"环节,正是本文参考生视频能力的主战场。

评论 (0)