Wan 3.0 登陆 Runway 实操:多参考素材一次挂 10 图 5 视 5 音,出 30 秒原生音频成片
8 月 24 日,Runway 在更新日志里官宣了一件事:阿里的旗舰视频模型 Wan 3.0 正式进驻 Runway,工具模式和工作流里都能用。对想用 Wan 3.0 的人来说,这等于多了一条现成入口——不碰百炼控制台、不装 ComfyUI、不跑命令行,登进 Runway 就能把图片、视频、音频素材一起交给模型,换出一条最长 30 秒、画面和声音同一遍生成的成片。
这篇教程把 Runway 官方模型页上的用法整理成可以照着点的流程:三种起手方式怎么选、参考素材怎么挂、参数在哪设、积分怎么扣。Wan 3.0 的产品页和Runway 的产品页都在站内。本篇属于《Wan 万相》手册的续篇,前四章分别讲了网页版路径、提示词公式、ComfyUI 工作流和命令行,这一章补上 Runway 这条海外入口。
先弄清位置:Wan 3.0 在 Runway 的哪里
更新日志的原文很短,信息量却不小:
Wan 3.0 is now available in Runway in tool mode and workflows. Generate near state-of-the-art video with audio, using multiple image, video, and audio reference inputs, at 480p, 720p, or 1080p.
翻译过来是三层意思:第一,位置有两个——工具模式(Tool Mode)和工作流(Workflows),前者是单次生成的常规界面,后者是节点式的批量管线;第二,卖点是多参考输入,图片、视频、音频可以混着给;第三,分辨率从 480p 到 1080p 三档。官方 FAQ 也确认了这个开放范围:已经推送给所有 Runway 用户,按分辨率和时长计积分。
万相家族的开源线和旗舰线怎么分、和阿里官方入口有什么差别,手册第一篇讲过,这里不重复。只需要记住一件事:Runway 上的 Wan 3.0 是托管服务,模型跑在 Runway 的算力上,和本地部署 Wan2.2 是两条完全不同的路。
三种起手方式,对应三种素材状态
官方页面把 Wan 3.0 的用法归纳成三种,按你手头有什么来选。
只有一句描述、什么素材都没有,走文生视频。提示词里可以写画面、写运镜,甚至写配乐该是什么感觉,模型从文字直接建镜头。
手头有一张现成的图想让它动起来,走图生视频。给它一张静图加一段提示词,镜头就从这张图的位置开始演;还可以钉一张尾帧图,让片段最后落回你指定的画面——首尾都定了,中间怎么走交给模型,适合「从 A 状态演变到 B 状态」这类镜头。
手里有角色照、产品图、实拍片段甚至音轨,想让它们在新场景里保持一致,走参考生视频。把素材挂进去,人物、产品或风格会在模型新造的场景和角度里保持可辨认。官方页对这一路的概括是「Keep every shot consistent」——每一个镜头都保持一致,系列内容、广告片里角色形象不漂移,靠的就是这条路。
官方页给了一个图生视频的完整示例,输入图是黄昏天空下一个悬空的人影剪影,提示词原文如下:
A woman ascends and floats in mid-air, camera arcs around her and slowly pushes in to close up, fluid camera motion(一位女子升起到半空漂浮,镜头绕着她弧形运动并缓缓推近到特写,运镜流畅)

官方示例的输入参考图:黄昏天空下悬空的人影,配上文中的提示词生成升空漂浮镜头
这条提示词值得抄下来改:它把主体(女子升空漂浮)、运镜(弧形环绕、推近特写)、动态质感(fluid camera motion)三件事各写了一句,没有一个字浪费。写自己的镜头时照这个密度组织语言,比堆形容词有效。声音同样可以写进提示词——官方页对文生视频的说明是「描述场景、镜头、甚至配乐」,想要什么样的环境声和音乐情绪,直接写进句子里的效果比事后配音更贴合画面节奏。

官方模型页的演示画面:雨夜跑道上的短跑运动员,水花和灯光这类真实物理运动是 Wan 3.0 强调的改进点
跟做:挂素材、设参数、点生成
官方页给的操作流程是三步。
第一步定起点。进 Tool Mode,在模型选择器里选 WAN 3.0,然后决定从什么开始:一段纯提示词、一张要动的图,或者一组横跨图、视频、音频的参考素材。三种起点对应上面三种方式,界面上传对应类型即可。
第二步设输出。这里要定四件事:画幅比例、分辨率(最高 1080p)、时长(2 到 30 秒之间任选,一次生成一条连续片段,镜头切换和节奏变化已在同一次生成里完成)、以及音频开关。音频默认是开的——对话、环境声、音效和画面同一遍生成,从第一帧起就同步;不想要声音可以在生成前关掉。
第三步生成。片段回来时画面和声音是绑在一起的,可以直接下载,或丢进 Workflows 接后续节点。官方页在「Make your first Wan 3.0 video」一节里把动作压缩成一句话:描述你要的片段、挂上参考、点生成。对第一次跑的人来说,这就是全部——没有隐藏步骤,没有必须先调的参数。
界面上具体长什么样,开发者门户的快速上手页给了参照:画幅一栏除了常见的 16:9、9:16、1:1、4:3、3:4,还有一个 Auto 选项,让模型按内容自己挑画幅;时长是下拉框,从 2 秒到 30 秒逐秒可选;音频是一个 Generate audio 勾选项,默认勾着,出声不想要就取消再生成。网页端的 Tool Mode 布局与此一致。

官方模型页的另一段演示画面:后厨颠锅窜起的火焰,水、布料、快速动作这类实拍质感的运动是官方点名的能力项
有一个容易踩混的地方官方 FAQ 单独写了:关键帧和参考是两种独立模式。单张图钉成精确首帧(可选尾帧)属于关键帧;要混搭图片、视频片段和音轨时,参考图不要指定帧位置,原样作为无位置参考传进去。两种用法不能互相替代——想让画面严格从某张图开始,用关键帧;想让角色或产品在全新场景里被认出来,用参考。
参考素材的账本:10、5、5
参考输入的上限,官方写得很具体:一次请求最多 10 张图片、5 段视频、5 条音轨,和提示词一起给,输出会跟随这些素材。FAQ 里还有一条配套细节:如果只用单张图,它可以换成另一种用法——钉成精确的首帧,可选再钉一张尾帧;但关键帧和参考是分开的两套模式,混用时参考图要保持「无位置」状态,别既当首帧又当参考。
这三类素材各管一摊。图片负责让人物、产品、画风在新场景里可辨认;视频片段给的是动作和镜头语言;音轨给的是声音样本。做角色短片时,一组角色定妆照加一段实拍动作参考,再挂一条配音样音,一次生成就能拿到形象、动作、声音都对得上的片段。注意三者不是必填项——纯提示词空手起镜头完全合法,参考素材是增强项不是门槛。
挑素材时宁少而准。上限是 10 张图,不代表每次都要挂满——参考越多,模型要同时对齐的约束越多,先从最小组合试起,缺什么再补什么,比一上来全挂满更容易控制结果。每类素材的格式也有讲究:上传前把视频片段剪到最能代表目标动作的那几秒,音轨截干净,比原素材整段丢进去效果好。

官方模型页演示画面:日式后厨里抛起的燃面火焰,密集粒子与明暗过渡同样吃分辨率,高分辨率档在这类画面上更明显
如果要把这套能力接进自己的产品,Runway 的开发者平台以模型 ID wan3 提供文生视频和图生视频两个端点,官方说明里明确这两个端点带完整的参考预算、时长和分辨率支持。
积分怎么扣,边界在哪
费用是绕不开的话题。更新日志把 Wan 3.0 这条归在 Paid Plans 分类下,按积分计费,扣多少取决于分辨率和时长。开发者门户的快速上手页给了具体数字:480p 每秒 5 积分、720p 每秒 10 积分、1080p 每秒 20 积分——换算下来,一条 30 秒 1080p 的片段是 600 积分,一条 5 秒 480p 的试错片段只要 25 积分。数字以官方页面为准,但量级关系是清楚的:先用低分辨率短片对方向,确认后再上高清长片,能省下大量积分。30 秒是单次生成的上限,也是积分消耗的上限——更长的片子官方没有提供拼接工具,需要自己在 Runway 外接剪辑。
几条白纸黑字的边界,用之前心里有数:单次生成最长 30 秒,好在镜头切换在同一次生成里完成,多数短片不需要拼接;分辨率最高 1080p,没有更高的档;音频可以整体关掉,但官方没有提供关掉画面只出声音之类的反向操作;免费档具体送多少积分,官方页面没有写死,登录后以自己的账户页面为准。
Workflows 那条入口多说一句。Runway 帮助中心对 Workflows 的定义是「节点式的媒体生成方法,对创作过程的每一步给你细粒度控制」——Wan 3.0 在里面是一个可编排的模型节点。什么时候值得从 Tool Mode 搬进 Workflows:同一组参考要批量出多版本时,或者上游要接其他模型节点(比如先出图再喂给 Wan 3.0 动起来)时。单条片子、手工调参,Tool Mode 更直接。
最后是模型选择层面的背景:Runway 把各家模型收进同一个工作区,官方 FAQ 列出站内还有自家的 Gen-4.5、Aleph 2.0,以及 Seedance 2.5、Kling 3.0、Veo 3.1 等。Wan 3.0 在这个阵容里的差异化就是多参考输入加原生音频这一套,素材多、一致性要求高的项目它最顺手。
本文依据 Runway 官方 Wan 3.0 模型页与更新日志(2026-08-24)整理,示例提示词与图片均来自官方页面,版权归原作者所有。