入门 约 25 分钟 2026-09-23 04:48:56 · 3 阅读

豆包写剧本、即梦出片:AI漫剧五步工作流,提示词模板直接抄

先把整条链路摆出来

做一条 AI 漫剧短片,要过五关:剧本、分镜提示词、人物场景图、动态视频、剪辑合成。单看每一关都有人教,串起来跑通的反而不多。这篇把五关连成一条线:豆包负责前两关(写剧本、提分镜),即梦负责中间两关(出图、图生视频),最后一关交给剪映。全程照着点就能走完,两个提示词模板可以直接复制去用。

这是即梦 AI 视频实战手册的新一章。前面几章讲了文生视频入门、Seedance 多参考素材怎么用、即梦和剪映怎么联动出片,这一章补上最前面的一环——剧本从哪来、提示词怎么不靠手写。手册完整目录在这里:即梦 AI 视频实战,即梦产品介绍见产品页

先说清楚这套流程适合谁:想用 AI 做漫剧、国风短片、绘本感小视频,但不会写剧本、也背不下提示词公式的人。它不要求你有任何剪辑或绘画基础,会打字、会复制粘贴就能跑完第一遍。

准备工作:两个账号,五分钟

豆包:浏览器打开 www.doubao.com,手机号或抖音账号登录,对话功能开箱即用,不需要开任何付费项。

即梦 AI:打开 jimeng.jianying.com,字节系账号直接登。每天有免费生成额度,具体次数以你账号当天的页面显示为准——免费额度跑一条短片的核心素材是够的,但批量出图阶段很容易见底,要么等第二天刷新,要么开会员。

剪映:电脑装剪映专业版,或者手机用剪映 App 都行,最后一步只用到排片段、加音轨、导出这三个基础功能。

工具就这些。下面进入正题,每一步都写清楚:在哪个工具里、发什么指令、应该看到什么。

第一步:让豆包当编剧

别自己憋剧本。漫剧的剧本本质是分镜脚本:每个镜头几秒、画面是什么、谁在做什么。这种结构化文本正是对话模型擅长的,你要做的只是给它一个身份和一个明确的任务。

在豆包里新开一段对话,第一条消息直接套这个模板:

你是一名[资深编剧/动漫导演];请创作一个关于[具体题材内容]的剧本;时长控制在[XX秒]左右。

方括号里的内容按你的题材替换。想试国风奇幻,就填「资深动漫导演」+「古风青年书生误入水墨幻境」+「120秒」;想做甜宠校园,就换「资深编剧」+「高中教室递笔的青涩瞬间」+「60秒」。

发出后等它写完,你应该看到一份成体系的剧本文本:片名、整体风格定位、主角设定(年龄、外形、气质),然后是按时间轴切好的分镜段落,每段标着镜头时长、画面内容和人物动作。原文实测跑出来的是一部叫《墨隐山河》的水墨国风短片文案,主角「青衫博士·云砚」连随身物件都写好了,分镜按 15 秒一档排满两分钟,第一镜是这样的:

【0:00–0:15 | 入境·韵】画面:晨雾漫过青瓦古镇,老松垂枝,石案上铺着素白长卷,青衫博士静立案前,提笔蘸墨。

这个颗粒度就是你要的成品形态:每条分镜自带时长、场景、动作,后面转提示词、排镜头全都靠它。拿到这种结构的剧本,直接进第二步;如果输出只是干巴巴的剧情梗概、没有分镜时间轴,就追问一句「请改写成分镜脚本,每个镜头标注时长」,别将就。

如果第一版不满意,直接在对话里提要求:「主角改成女性」「节奏再快一点,砍掉铺垫镜头」「第二镜换成夜戏」。改剧本比写剧本便宜得多,多改两轮再进入下一步。

豆包生成国风短片剧本的对话截图

用「编剧身份」提示词让豆包产出带秒级时间轴的分镜剧本

第二步:把剧本逆向拆成即梦提示词

剧本到手后,很多人卡在「剧本怎么变成生成器的提示词」。答案是不用手动转——紧接着在同一段对话里发第二条指令,原文管这叫逆向提取:

请提取上述分镜中的人物和场景,并给出能用于即梦AI生成的中文提示词。

因为模型还记得上文,它会自动把剧本文本拆解重组成即梦能直接使用的中文提示词。你应该看到输出分成几类:人物核心提示词(外形、服装、神态、身形,一段成文)、场景核心提示词(地点、陈设、光线、氛围,一段成文)、融合类画面提示词(按镜头逐条给),通常最后还会附一段整合好的「直接复制使用」完整版。原文的例子里,连「墨汁发光、古文字悬浮幻化成流云」这类奇幻元素都被单独归成一类。

到这里先别急着关对话框。检查两件事:人物描述是否前后一致(眼睛颜色、服装年代别在两个镜头里打架);场景数量是否和分镜数对得上。缺什么就追问什么:「补一个反派人物的提示词」「把第三场雨夜单独展开写」。

这些文字都留在对话记录里,出图阶段直接整段复制,不用再手写一个字。

豆包按人物场景分类输出即梦可用提示词

第二条指令让豆包把分镜拆成人物、场景、奇幻融合三类即梦提示词

第三步:先定调,再批量出图

出图前先解决风格问题。风格不统一,片子就是一锅粥——第一张图水墨风、第二张变赛博朋克,观众立刻出戏。原文的做法是:选一张你最心仪的参考图(别的作者画的、电影剧照、AI 生成的都行),让 AI 反推提示词,把反推结果钉成整个短片的视觉基调。一个可直接用的定调写法:

国风暗黑奇幻风格,超写实电影级质感。

基调定了,再去生成具体的人物图和场景图。这一步在即梦里用图片生成,每张图的提示词套这个公式:

人物 + 动作 + 场景 + 风格 + 构图

公式里「风格」那个位置,永远填你定调时的那串前缀,从头到尾一张都不要换——原文把这叫核心铁律,所有图片的风格前缀必须完全一致。形容词精简,直奔主题:与其写「美轮美奂令人惊叹的华丽古代宫殿」,不如写「唐代宫殿,对称构图,金色暖光」,后者每个词都对生成器有实际约束力。

人物形象不满意,微调关键词就行:把「温润清雅」换成「冷峻锐利」,重生成一两轮基本能到位。有一条经验值得抄下来——如果一张图生成 3 次还不满意,别死磕,问题几乎一定出在提示词描述上,回去改词,别赌运气。

这一步结束时,你的手里应该有:主角定妆图一到两张、每个场景各一张、关键融合镜头参考图若干。数量按你的分镜数来,一个 2 分钟的短片通常就是十几张的量级。

第四步:图生视频,让画面动起来

图片素材齐了以后,进即梦选「图生视频」:上传一张定稿图,配一段动态描述词。动态提示词的公式和出图不同,重心从「长什么样」转到「怎么动」:

主体 + 运动 + 场景 + 镜头语言

描述要具体到时间。原文举的例子很直观:是 5 秒完成挥剑,还是 10 秒完成回眸?时间档位不同,AI 给出的动效质感天差地别。想快节奏打斗就选短档,想氛围慢镜头就选长档,别都挤在默认档。

镜头语言也是提示词的一部分:「镜头缓缓推进」「环绕运镜」「固定机位」写不写,成片的观感完全两回事。不确定怎么写就回头翻第一步豆包给你的分镜文案,导演版剧本里通常已经带了运镜描述,直接抄。

多镜头素材可以全部丢进即梦的无限画布里统一摆放调度:每个镜头生成后在画布里摆到对应位置,整条片子的镜头顺序一目了然,比在文件夹里来回翻省事得多。下载到本地的素材,文件名会自动带上日期、编号和提示词片段,批量生成几十段之后靠文件名就能认出哪段是哪镜。

即梦批量生成的古风视频素材网格

按统一风格前缀批量生成后下载的视频素材,文件名自带提示词片段

第五步:剪映合成

最后一步把视频片段拼成片。打开剪映,把即梦导出的片段按剧本分镜顺序导入、排上时间线。配音不用另外找工具,剪映自带的 AI 音色选一个贴合角色的,生成后音频自动落在音轨上,位置不对直接拖。人物开口的镜头注意对上口型,对不上就把音频或片段微移几帧。音效和背景音乐按需添加——古风片配古筝、打斗镜头加兵器声,都是素材库里现成搜得到的。检查一遍整体节奏,导出。

配音音色怎么选、语速和停顿怎么调才不像机器播报,站内另有一篇《剪映 AI 配音》专讲这件事,这里不重复展开。

四个翻车点,提前避开

风格前缀中途换了。批量出图时最常见:出着出着觉得换个风格试试,结果前后镜头割裂。定调那串前缀写进备忘录,每张图原样带上。

提示词堆形容词。「唯美」「震撼」「大片感」这类词对生成器几乎没有约束力,换成具体的时代、材质、光线描述才有用。

一张图死磕十几遍。3 次不满意就回去改提示词结构,换要素比换运气快。

动态描述没写时间。只写「挥剑」不写几秒完成,模型自己猜节奏,成片动效经常和预期对不上。5 秒和 10 秒是两段完全不同的动作设计。

还有一个额度层面的提醒:即梦免费生成次数有限,第三、四步是烧额度的大头。先用三五张图把风格调稳、确认前缀好使,再放量批量生成——返工最贵的不是时间,是额度。

这套流程里人和 AI 各干什么

跑完一遍你会发现,AI 负责的是创意的量产:剧本、分镜、画面、动效都能批量给。你负责的是筛选、审美和组装——决定留哪版剧本、统一什么风格、按什么顺序剪。原文的说法是「AI 负责出创意、出分镜、出画面;你负责筛选、审美和最后的组装」。第一遍跑通之后,第二遍开始产能瓶颈就不在工具上,而在你的判断速度上。

最后给个务实的起点:别一上来就挑战 120 秒正片。先用 30 秒、三四个镜头的迷你篇幅把五步全走一遍,跑通整条链路,再回头加长。流程熟悉了,加长只是量的问题。

本文工作流与配图整理自微信公众号公开教程《豆包+即梦AI漫剧实操:3天从0到1》,两个提示词模板与「3 次不满意就改词」等经验均为原文内容,版权归原作者所有。

评论 (0)