一句话生成一条 4 分钟AI视频:拖了半年的技术债,我迭代 7 版还上了
TUTORIAL · 实战教程
2026.09
AI 一键成片还是 PPT 混剪?
一句话生成一条 4 分钟
AI 故事视频
零成本 · 状态机 · 迭代 7 版 · Agent 自动化
AI智识新语 · 黄彬
AI视频Agent今年 2 月,有位网友在后台问我:“AI 现在能不能给一句话,就直接生成一条完整的视频?”我当时回她:“上半年差点意思,等到下半年就可以了。”
直到最近,看到大雷老师开源的 Skill:image-story-video-wizard,在推特上爆了 30 多万浏览。我认真看了下,抖音、视频号上那些音频+图文讲书、讲历史的爆款账号,用它可以做到一天双更。
既然商业闭环有人跑通,加上 ZCode 里的 GLM 5.3 Flash 夜间 23:00 后能免费用,我就把这笔拖了半年的“技术债”还上,完整跑一次实战。
整套流程跑下来,从头到尾真就只用给一句话,中间顺手回答几个选择题,一条 4 分钟的完整故事解说大片就做出来了。
第一版还有些小问题。本着实战落地,我前后带着模型迭代了整整 7 个版本。改到第 7 版,成片效果完全惊艳到我了。今天这篇既是记录,也是一份保姆级实操指南。

— 只给一句话、回答几道选择题,Agent 自动跑出 4 分钟成片
01
PART
为什么年初不行,现在突然行了?
WHY · 时机转折点
去年下半年市面上有一大堆号称“AI 一键成片”的工具,但点开一看,全是把公版素材和生硬图片胡乱混剪,逻辑差、没有故事性,完全看不下去。
真正可商用的一句话视频,必须严丝合缝地打通四件事:写脚本、出画面、做动效、配声音。过去没有成熟的 Agent 机制,这 4 个模块很难连起来。
转折点在最近几个月:
1智能体长程任务能力有了质变:从 Openclaw 小龙虾到 harness 深度执行框架,Agent 已经能严格按照十几道工序执行长任务,中间报错还会自主排查、自动校正。
2AI 能真正接管电脑了:它不需要繁琐代码,而是像人一样复用你的浏览器登录状态,打开网页、点击按钮,甚至自主调用系统软件。
本次使用的核心就是大雷开源的 Skill。它把叙事解说的生产链条,直接打包成了一条标准流水线。

— 写脚本、出画面、做动效、配声音,四个模块被 Agent 串成流水线
02
PART
动手前的准备清单
PREP · 资源与成本
先算一笔账,这是我跑出来的最终成片规格:时长 3 分 55 秒,包含 25 张高精度定制插画、100 条独立动态字幕,以及 14 张核心论点卡片。
需要提前备好这几样东西(能省则省):
| 工具 / 资源 | 作用 | 省钱小贴士 |
|---|---|---|
| ZCode 客户端 | 运行智能体框架 | 挂载 GLM 5.3 Flash,夜间 23:00 后免额度;也可用 Workbuddy |
| 视频生成 Skill | 核心装配流水线 | GitHub 搜索:aaronyi97/image-story-video-wizard |
| ChatGPT 网页账号 | 批量自动化出图 | 走网页端额度,无需额外买 API;也可用魔搭/豆包/ComfyUI |
| TTS 语音工具 | 故事全流程配音 | 首选本地 Breeze TTS 2(零成本);也可 Skill 内置豆包/百炼 |
03
PART
四步上手:装好、启动、答题、迭代
WORKFLOW · 状态机
第一步:装好 Skill,看懂这台“状态机”
打开 ZCode,输入提示词安装:
PROMPT请从 https://github.com/aaronyi97/image-story-video-wizard 安装 Skill。Skill 位于仓库根目录,安装名使用 image-story-video-wizard。安装完成后告诉我下一轮可以直接启动,并严格按照流程设计主动引导我推进视频的制作。
这里先提前说一下:它绝不是那种丢进去就盲盒瞎跑的工具,而是一台极度严谨的“带检查点状态机”。
...FLOW运行 → BRIEF需求 → 找对标 → 写作包 → 脚本敲定 → 配音试听 → 分镜设计
→ 画风锁定 → 批量出图 → 动态组装 → 成片预览 → 迭代反馈
每到一个关键节点,它都会停下来等你确认,确认通过才进下一步。这个设计对新手极度友好。

— Skill 停在 BRIEF 阶段检查点,像导师一样逐项确认后再推进
第二步:只给一句话,把任务丢给它
在对话框里唤起 Skill,输入一句话即可:
启动 image-story-video-wizard 制作一个关于 AI 与“杰文斯悖论”的视频
注意,我连大纲和分镜都没给,就给了一个生僻的经济学概念。不要堆砌又长又乱的要求,它后面自会向你提问。
第三步:它逐关问,你逐关答
接下来只需要在关键节点做好选择:
1BRIEF 阶段:确认时长(3~5 分钟)、16:9 横屏与发布平台;
2对标与写作包:确认它检索出的 4 个优质对标,把文案拆解为结构、钩子和叙事节奏;
3声音与画风:调用本地 Breeze TTS 生成 6 组试听 Demo,人工选“清爽男声”,画面定为“扁平编辑插画风”;
4出图与分镜:选 25 镜经济型方案,指定走 ChatGPT 网页端批量出图。
04
PART
第四步:从 V1 到 V7,填平暗坑
ITERATE · 七版打磨
第一版出来时框架已经很惊艳,但以视频标准来看,依然充满廉价感:
1开场画面太平庸,留不住人;
2字幕堆叠,好几行字糊在屏幕中间;
3全是静态图片切换,幻灯片感极强;
4最致命的 Bug:每次切镜头画面都会黑屏闪烁一下。

— V1 的黑屏闪烁 Bug,到 V7 用预挂载+淡入彻底修成丝滑切换
为了达到商业级水准,我带着 Agent 从 V1 一路死磕到 V7,把这套打磨方案直接固化进了工作流:
1打造黄金开场:让模型重写 Prompt,生成“一枚陨石箭头轰然砸向芯片未来城”的高冲击画面作为视觉钩子;
2重构动态字幕与排版:改用得意黑字体,按标点切碎成单行短句,加入弹簧弹出动画,顶部加琥珀色进度条;
3引入 Remotion 镜头运动:把每张静态图解构成推、拉、摇、移 6 种镜头动态,镜头交接处打 10 帧交叉淡化;
4解决切图闪烁:换用更强的 GLM 5.3,锁定“提前 30 帧在后台预挂载解码、再平滑淡入”的代码方案。
全部改完再看,成片彻底对味了!
05
PART
最核心的两个技术绕道法
HACKS · 省钱路径
很多朋友最怕生图和配音花钱,这里把我摸索出来的路径分享给大家。
1. 浏览器自动化出图
这个 Skill 启动出图时,会在后台自主调度系统浏览器,复用你现成的 ChatGPT 网页登录凭证去生成图片。图生成完自动下载并归档重命名,全自动流水线作业,一分钱 API 费都不用多掏。如果没有GPT会员,用国内的modelscope(魔搭社区)的 API 调用Qwen免费生图也可以(如果想知道具体怎么配置,评论区留言,我单独写一篇)

— 后台自动调用 ChatGPT 网页端批量出图,复用网页额度
!避坑小贴士 🕳
如果你的故事有固定主角(比如历史人物或广播剧),切记让它先生成一张“人物母版图”,后面每张分镜都要垫图参考,防止角色长相每张都变。
2. 替换本地 TTS 声音模型
如果你的电脑配置还可以(12G及以上显存),直接让 Skill 对接本地部署的 Breeze TTS 2 等开源语音模型,既不用买云端语音 API,合成速度也更快。
///
LAST
写在最后
FINAL · 先发出来
算一算综合成本:模型调用蹭的是夜间免额度福利,生图用的是网页额度,声音跑在本地,整条 4 分钟的高清故事视频几乎以接近零的边际成本跑了出来。
这套模式特别适合想要测试故事视频赛道的新人。但我还是那句话:别陷入“追新综合症”,也不要在第一期上关门死磕一个月。
视频是做给观众看的,不是做给自己的硬盘看的。
哪怕前几期粗糙点,先用最快速度跑通闭环发出去拿反馈。如果连续做了半个月流量起不来,果断复盘换赛道,没必要在一个方向上硬耗。
前期流程交给 Agent,后期的质感与判断留给人。赶紧去把这个开源工作流跑起来试试,期待在评论区看到大家的爆款成片!
如果你也想要这个skill 和提示词,请在后台回复“一键成片”,我发你。
我是黄彬,一名在云南做 AI 培训与企业 AI 数字化落地,也通过 Vibe Coding 做 AI 项目的独立开发者。
既然读到了这里,若有启发与收获,欢迎点赞、在看与分享。
点赞在看转发NATURAL & INSPIRATIONAL