前几天刷推看到一个开源项目——有人做了一套 AI 短剧的完整流水线。丢一本小说进去,能一路跑到分镜和视频生成。
我拿西游记前 7 回试了一下,跑出来的东西超出预期。

10 个角色的完整设定卡(带形象图)、6 集大纲、15 场剧本、分镜提示词,最后用 MiniMax H3 生成了一段 30 秒的视频。整条链路从 txt 到视频,中间没有手动写一个提示词。
01
做 AI 短剧的第一步不是生视频
THE REAL FIRST STEP
这段时间 MiniMax H3 本地能跑了,好多人觉得 AI 短剧的门槛塌了。
我也这么想过。但真去做的时候发现一个问题——角色不固定,后面每一步都会跑偏。你第一段生成的孙悟空是金毛,第二段就变黑毛了。场景也是,前一秒天宫像欧式城堡,后一秒变回中式宫殿。
在生视频之前,先把角色、场景、剧本、分镜全部固定下来。

我决定跑一遍看看。
02
这套工具长什么样
THE TOOLCHAIN
6 个 Skill,一条流水线:
小说原文 → 改编大纲 → 角色设定 / 场景清单 / 剧本 → 分镜 → 视频生成
每一步都有脚本做质量检查——不是靠 AI "自觉",而是代码硬卡。比如角色不能超过上限、爽点间隔不能太长、台词单句不能超过 35 个字。
安装很简单,git clone 下来跑个脚本就行。Claude Code 和 Codex 都能跑,用你自己的订阅额度,不用额外配 API key。
03
我拿西游记试了什么
TESTING WITH JOURNEY TO THE WEST
选了前 7 回——大闹天宫篇。角色多、关系复杂、视觉冲击强,适合测试。
第一步:拆角色
4.4 万字丢进去,AI 扫出来 26 个角色,自动合并了不同称呼("美猴王""齐天大圣""弼马温"都归到孙悟空)。我选了前 10 个做完整设定——每个角色包含人物画像、形象提示词、音色提示词、性格分析。

生成的角色图挺有意思。孙悟空是金毛、火眼、紫金凤翅冠,跟原著描写对得上。
▼ 生成的 10 位角色设定图(左右滑动查看)

孙悟空

观音菩萨

菩提祖师

二郎神

哪吒

玉皇大帝

太白金星

李天王

太上老君

东海龙王
第二步:写大纲
设定 6 集、每集 3 分钟、神话题材。AI 自动砍线、合人、排爽点。有 13 道质量门卡着——比如爽点间隔不能超过 3 集、第 1 集必须有钩子、大爆点不能压在最后一集。

看这张爽点时间轴。每集的高潮点分布得很均匀,不是所有爆点都堆在最后一集。第 1 集就有"发现水帘洞"和"拜师学艺"两个钩子,第 4 集放了"偷吃蟠桃"的大爆点。

每集有概要、悬念、钩子。第 6 集的悬念是"被压五行山后能否等来解救"——为续集留口。

这张是 AI 做的改编决策记录。它主动砍掉了一些支线(比如龙王送兵器的细节),合并了"弼马温"和"齐天大圣"两段为一集,理由是"节奏更紧凑"。

调度矩阵能一眼看出谁在哪集出场。孙悟空全程在线,菩提祖师只出现在第 2-3 集,太上老君集中在第 5 集。

13 道质量门全绿通过。这不是 AI 自己说"我检查了没问题"——是跑了一个独立的 Node 脚本去验证 JSON 结构、爽点间距、角色引用完整性等硬指标。
第三步:写剧本
6 集、15 个场次、63 句台词。每集时长按语速自动折算(中文按 4 字/秒),台词按角色聚合后直接能对接 TTS。

单句台词卡在 35 个字以内——给配音用的,太长一口气读不完会断气。

看这个场次列表。每集里谁在什么场景说了什么话,一目了然。动作描写穿插在台词之间,不是干巴巴的"孙悟空说"。

注意台词右边的情绪标注(mood)。这个参数是给 TTS 引擎用的——不是平读,是带感情的。"愤怒""得意""恐惧"直接控制语气。

时长精确到秒。每集目标 60 秒,实际跑出来 50-58 秒,在容差范围内。

质量门全绿。台词长度、场景引用、角色 ID 匹配——又是一个独立脚本硬验的。
第四步:切分镜
第 1 集切成 5 个段、15 个分镜,每段自带 MiniMax H3 的视频提示词。这些提示词不是我写的,是 Skill 根据剧本和角色设定自动生成的。

每段有一张关键帧图片(用 gpt-image-2 生成),作为视频生成的首帧参考。
第五步:生成视频
拿分镜提示词调 MiniMax H3 的 API,用上一段的尾帧当下一段的首帧,保证视觉连贯。最后 5 段拼成 30 秒的完整片段,再用 ChatCut 加上配乐和音效。
04
踩到的坑
PITFALLS
角色图是用 Claude Code 调 API 生成的,但直接传给 MiniMax H3 的视频 API 会报错——图太大(2MB+),压缩到 200KB 以下才行。
哪吒的图生成失败了一次——提示词里有 "child warrior",触发了内容审核。改成 "youthful celestial deity" 就过了。
分镜之间的连贯性是最大的问题。如果每段独立生成,角色长相和场景风格会跳变。解决方案是串行生成——每段用上一段的最后一帧当首帧。代价是不能并行,5 段要等 20 分钟。
05
我的判断
MY THOUGHTS
这套工具解决的核心问题是:在生视频之前,先把创作决策固定下来。
角色长什么样、场景什么氛围、台词怎么说、镜头怎么切——这些不应该在生视频的时候才临时决定。固定了这些,后面换任何视频模型都能保持一致。
AI 短剧不是一个工具的事,是一条工作流。这套 Skill 把工作流的每个环节都拆成了可检查、可重复的步骤。
如果你手上有一本想改编的小说,这套东西值得试试。clone 下来装好 Skill,丢一个 txt 进去就能跑。