入门 约 15 分钟 2026-09-10 10:27:57 · 3 阅读

可灵 AI 零基础第一条视频:一句「橘猫戴墨镜在故宫滑滑板」,5 分钟拿成片

五分钟,第一条会动的片子

想发一条短视频,卡在没有素材也不会剪辑上——这种情况现在有个很省事的解法:打开可灵 AI 的网页,把想要的画面用一句中文写给它,等一会儿,拿回一段带运镜的成片。可灵(Kling)是快手旗下的 AI 创作平台,生成能力覆盖视频、图片和声音,视频侧目前的主力是 VIDEO 3.0 系列:单次最长 15 秒、能出原生音频、支持一句话里写多个镜头。

这篇把从注册到下载成片的每一步都摊开写,照着点就能走通。案例提示词、参数、积分价格全部来自可灵官方文档与公众号教程原文(出处见文末),属于站内 AI 视频制作总纲里「文生视频」的起点,可灵的完整能力介绍见产品页

先看一笔账:为什么值得换工具

做一条「猫咪戴墨镜滑滑板」的 5 秒短视频,公众号教程《可灵AI入门教程:5分钟生成第一条短视频》里算过一笔传统流程的账,照抄如下:

找素材:去 Pexels / Pixabay 搜「cat skateboard」→ 30 分钟;剪辑:剪映导入素材,截取 5 秒,配字幕,配 BGM → 20 分钟;加特效:猫咪戴墨镜需要抠图 + 叠加 → 30 分钟;导出:1080P MP4,导出 2 分钟 → 2 分钟;发布到小红书 → 5 分钟。合计:87 分钟

同样的需求交给可灵:写一句提示词,等约 90 秒生成,下载约 10 秒。原教程的对比表把两边的合计写作 1 小时 35 分钟对 1 分 40 秒——数字偏理想化(不含写提示词和挑结果的工夫),但量级差距是真实的。技术门槛那一栏更实在:左边要会剪映或 Premiere,右边会打字就行。

开工前的三个事实

账号与入口:浏览器打开 klingai.kuaishou.com(国内版),右上角「登录」支持手机号一键注册,移动联通电信都行。首次登录要做一次实名认证(刷脸或身份证号),之后不再弹。可灵也有独立 App,应用商店搜「可灵 AI」可下,手机端生成体验更顺手。

费用:新账号有免费额度可以起步(公众号原文写「0 成本」生成第一条),但视频生成按秒扣积分。VIDEO 3.0 官方价格:带原生音频 1080p 是 12 积分/秒、720p 是 9 积分/秒;不带音频 1080p 8 积分/秒、720p 6 积分/秒;官方口径的计算例——5 秒「原生音频 1080p」视频消耗 60 积分,5 秒「无音频 720p」消耗 30 积分。练手阶段选无音频 720p,一条 5 秒视频 30 积分,最省。国内版界面里积分显示为「灵感值」,名称不同、扣法一致,以官方页面为准。

时长与画幅:一次生成 5 秒或 10 秒起步;VIDEO 3.0 支持单次 3~15 秒的弹性时长。画幅三选:16:9、9:16、1:1,发抖音小红书选 9:16,横屏演示选 16:9。

四个步骤走通全流程

第 1 步,进对入口。登录后一般直接落在创作页;没有的话,顶部菜单点「AI 视频」,左侧选「文生视频」。公众号教程对页面长相的描述很直白:「一个大白框 + 上面一个文本输入框」,没有多余的机关。官方英文版界面的布局可以参考下面这张官方指南配图:左边是 Generate 入口和素材库,中间是提示词与参数面板,右边是生成结果和预览。

可灵 VIDEO 3.0 生成界面总览

可灵官方用户指南里的生成界面:左侧 Generate 入口,中间提示词与参数区(1080p/15s/Native Audio),右侧成片预览与资产列表(图源:可灵官方文档)

第 2 步,写第一句提示词。不着急发挥,先用现成案例跑通流程。公众号教程用的演示提示词原文:

「一只橘猫戴着墨镜在中国故宫红墙上滑滑板,电影级运镜」

这句为什么好使:主体(橘猫)+ 主体细节(戴墨镜)+ 场景(故宫红墙)+ 动作(滑滑板)+ 镜头语言(电影级运镜),五个要素一句占全。官方《Text-to-Video Prompt Guide》给的公式也是这个骨架:

Prompt = Subject(Subject Description)+ Subject Movement + Scene(Scene Description)+(Camera Language + Lighting + Atmosphere)

括号里的镜头语言、光线、氛围是可选增强项。官方拿「A giant panda is reading a book in a café」做过一轮递进演示:加上黑框眼镜、桌上冒热气的咖啡、窗边的位置,画面就具体了;再加「中景、背景虚化、氛围光、电影级调色」,质感又上一层。照这个思路把橘猫那句改写,可以扩成:

「一只戴墨镜的橘猫在故宫红墙下蹬滑板前行,镜头低角度跟拍,午后侧光,红墙琉璃瓦色彩饱满,电影级调色」

第 3 步,设参数再生成。模式按预算选:标准模式出片快、消耗低,专业模式画质更好、扣得也多,第一次就选标准。分辨率练手用 720p,正式出片换 1080p;时长 5 秒;画幅按发布平台选。检查一遍,点右下角「生成」。生成中不要退出页面,排队的任务生成完会出现在右侧列表里,一般一两分钟内出结果。对效果不满意就改提示词重来,这是正常循环,别指望一句定稿。

第 4 步,挑片下载。右侧结果卡片点开预览,播放确认画面和运镜都过关,再点卡片上的下载图标存到本地。生成结果会留在「资产」列表里,随时可以回看、重新下载,也可以在结果上继续做口型同步(Lip Sync)、抽取某一帧做封面(Extract Frame)。

可抄的官方示例提示词

官方提示词指南的后半部分放了一批创作者实跑案例,每条都标了画幅、模式和时长,拿来当起手式最稳。挑四条直译过来,中文场景直接照抄,英文场景可以换成等价的中文描述:

Prompt: A polar bear is playing the violin in the snow. — Ratio: 16:9, Mode: Standard Mode, length: 5s
Prompt: Morning mist, sunrise, lens flare, and a cool breeze. A young Chinese woman with exquisite facial features, her long hair blown by the wind, strands of hair scattered across her face, dressed in summer attire, with a seaside beach as the backdrop. — Ratio: 16:9, Mode: Standard Mode, length: 5s
Prompt: Indoor shooting, close-up, a Chinese child is eating dumplings. — Ratio: 16:9, Mode: Standard Mode, length: 5s
Prompt: A medieval sailing ship sailing on the sea, a foggy night, bright moonlight, and an eerie atmosphere. — Ratio: 16:9, Mode: Standard Mode, length: 5s

看得出规律:这些句子没有一个超过两行,主语、动作、环境、氛围,各占一小截。新手常犯的错反而是把提示词写成小作文——信息堆太多,模型每一项都想照顾,最后哪一项都不精。官方在 Tips 里的原话是「Use simple words and sentence structures」,用简单词和简单句式,把复杂留给分镜。

官方盖章的四条局限

提示词指南的 Tips 部分写了几条当前模型的能力边界,抄过来逐条说人话:

一是对数字不敏感。「10 只小狗在沙滩上」这种带数量的描述,生成的只数大概率对不上,数数这件事目前别指望模型。

二是复杂物理运动容易翻车。官方原文点名「球的弹跳、高空抛物的轨迹」这类物理轨迹难以生成,想还原体育动作的,先降低预期。

三是单条容量有限。官方建议画面内容尽量在 5 到 10 秒内能演完,塞太满不如拆两条。

四是语言有技巧。写「东方意境」「中国」「亚洲」这类词更容易出中国风画面和中国人形象;想要分屏可以用「4 个机位,分别表现春夏秋冬」这样的写法。

跑顺之后往哪走

第一条片子到手,下一步通常是两个方向。一个是把镜头写得更细:官方指南里 VIDEO 3.0 的 Multi-Shot 开关打开后,一句话里按 Shot 1、Shot 2 逐镜描述,模型会自动规划转场和景别,单次生成多镜头叙事,最长 15 秒。下面这张官方图就是开关位置和逐镜提示词写法的实例:

Multi-Shot 开关与逐镜提示词

官方指南演示 Multi-Shot:提示词按 Shot 1/2/3 分段描述,参数区 1080p·15s·Native Audio,生成按钮显示本次消耗 450 积分(图源:可灵官方文档)

另一个方向是给画面加声音。VIDEO 3.0 的原生音频支持在提示词里直接写台词,说话人名字后接 @音色名关联音色(比如 Host @Warm Female Voice says, "Look at the stars..."),中英日韩西五种语言外加方言口音都能出。这条按官方界面的提示卡说明操作即可,注意带音频档位的积分消耗更高——上面 Multi-Shot 那张官方演示图里,1080p、15 秒、开原生音频的一次生成按钮就标着 450 积分。

再往后就是图生视频、首尾帧、动作控制这些进阶玩法,站内已各有单独教程可查。先用橘猫这句把流程跑通,比一次学十个功能实在。

官方熊猫咖啡馆示例成片

官方提示词指南的示例成片:戴黑框眼镜的熊猫在咖啡馆读书,即「A giant panda wearing black-framed glasses is reading a book in a café」的生成效果(图源:可灵官方文档)

本文步骤与配图依据可灵官方《Text-to-Video Prompt Guide》《Kling VIDEO 3.0 Model User Guide》及公众号《可灵AI入门教程:5分钟生成第一条短视频》整理,版权归原作者所有;积分价格与界面以可灵官方页面为准。

评论 (0)