上周刷抖音,看到一条 AI 足球燃片——姆巴佩和哈兰德在暴雨球场对决,全身闪电特效,15 秒看得我手痒。
我想做一条类似的。
打开工具一看,傻了。文生视频、图生视频、拉片复刻、首尾帧、技能制造机……方法一堆,每个都说自己好用,但没人告诉我哪个适合哪种场景。
我花了两天,拿自己的 IP 角色小月和小鹿当素材,把这 5 种方法全试了一遍。每种都出了成片,也踩了坑。
中间用了两个平台——小云雀和OiiOii。不是刻意对比,是小云雀积分快用完了,做不了几条,只好拿 OiiOii 来凑。实际体感下来,OiiOii 的功能更丰富一些,技能制造机这个玩法目前小云雀还没有。小云雀也有爆款复刻功能,但积分不够没来得及测。

OiiOii 首页

小云雀首页
下面是我的体感——不是工具评测,是一个不太擅长做视频的普通人的真实使用记录。
1文生视频:一句话出片
最简单的一种。打一段文字描述,AI 直接给你一条视频。
我试的是小云雀。提示词大概是"小月带着小鹿坐飞机去佛罗里达看海,15 秒,温暖治愈的插画风"。
等了大概两分钟,出片了。15 秒,画风统一,小月和小鹿从登机到飞行到海边,三个场景自然过渡。
说实话,比我预期好。我以为文字描述这么粗糙,出来会很散,但小云雀后端有自己的 Agent,会把你的一句大白话自动拆成分镜。你不用写镜头语言,不用管转场,说人话就行。
适合场景:脑子里有个模糊的画面,想快速看到"大概长什么样"。试错成本最低——不满意换个描述重来就是了。
局限:你对画面的控制力约等于零。AI 觉得怎么拍好看就怎么来,你只能"大方向对了就收"。
2图生视频:给它一张图,它给你一场戏
文生视频是从零开始,图生视频是"我给你起点,你往下演"。
我试了两条。
第一条是商品广告——把小鹿印在帆布包上,传了一张包的产品图给 OiiOii。它自动生成了模特、场景、运镜,出了一条 30 秒的广告片。帆布包上的小鹿印花全程零变形。

这里有个关键经验:IP 角色做成商品上的平面印花,而不是让它当会动的 3D 角色。印花不用动,所以不会变形——AI 动画最怕的就是"动起来就崩"。
第二条是炫技——用小云雀的 mini 模型,传了一张阿根廷 13 号球员的站姿图,让它生成一段倒挂金钩的射门视频。15 秒,动作流畅,球进网的瞬间还有慢动作回放。
图生视频比文生视频多了一层控制:你给了起点的画面,AI 会以这张图为锚点往下走。角色长什么样、穿什么衣服、在什么环境——这些不用你描述,图里都有。
适合场景:你已经有一张满意的图(产品图、角色图、场景图),想让它"动起来"。
局限:图的质量直接决定视频质量。图不好,视频也救不回来。
3拉片复刻:别人的爆款是你的模板
这个方法我踩了最大的坑,也学到了最实在的经验。
"拉片"是影视行业的术语,就是逐镜头分析一条视频。OiiOii 的拉片复刻功能做的事情很直觉:你选一条现成的爆款视频当模板,它帮你逐镜头拆解,你替换其中的角色、场景、元素,复刻出一条同结构的新片。
操作很简单,三步,都是自动的:
1. 它拆片 —— 把参考视频拆成拉片表,每个镜头的叙事、时长、镜头语言、影像处理全标出来
2. 你替换 —— 角色、场景、元素三栏,想换的传图,不换的留空让 AI 自己生
3. 它拼提示词 —— 根据你的替换自动生成一段完整提示词,你确认或微调
听起来很美,但我第一条就翻车了。
我选的参考片是"误入《地球 ONLINE》内测服"——画面里满屏中文 UI,什么"阿尔卑斯山""自然风光""发电机",大字飘在画面中央,每个场景都换。
出来的视频,"阿尔卑斯"变成了"阿尔背斯","自然风光"变成了"自然方方","发电机"变成了"发印机",连"济州岛"都写错了。

阿尔背斯山 + 自然方方

风力发印机 + 㳢州岛
我改了三版,都不行。
后来换了一条女团打歌的参考片,成了。13 秒,文字全对,氛围拉满。
为什么?我对比了两条,发现一个规律:
地球 ONLINE 那条,文字在画面中央,超大号,每个场景都换——AI 要反复画不同的中文大字,每次都是翻车机会。
女团打歌那条,文字在角落,小字幕,全程固定不变——AI 只需要画准一次。
"
AI 画"角落固定小字幕"稳,画"中央反复变化的大标题字"必崩。
所以选参考片的时候,优先选那种"靠画面、动作、转场"撑起来的,别选满屏中文 UI 的。带字的内容,字后期用剪映叠上去更稳。
顺便说一个有意思的细节。我给 OiiOii 写的提示词是大白话,就一句话:
请将角色形象替换成已上传的角色,增加非常明显的 kpop 女团风格的浓妆,包括哑光底妆/腮红/浓密长睫毛/亮面红色口红,角色呈现出唱跳完之后的喘气状态,面对镜头 wink 后,做比心等手势动作,全程 UI 字幕稳定不变,模拟女团个人打歌 ending 截图,场景以及其他未替换元素与原视频保持一致
但平台的 Agent 自动补出了完整的专业分镜——0-4 秒喘气微笑、4-6 秒闪烁故障特效跳切、6-13 秒 wink 比心定格。打光、UI 排版、色调全给你规划好了。
你说人话,它翻译成专业语言。跟小云雀的逻辑一模一样——用户侧只管说想要什么,技术编排是 Agent 的事。
适合场景:你刷到一条视频觉得"这个结构好棒,我想做一条类似的"。
局限:带复杂中文文字的参考片慎选。AI 画中文大字的能力还不够稳。
4首尾帧:只画两张图,中间 AI 补
你给 AI 一张起始画面、一张结束画面,它补出中间的过渡动画。适合什么场景完全看你怎么设计这两张图。
我做的是"打工人从深夜工位穿越到阳光海边"——首帧是小月疲惫地坐在冷灰蓝的工位前,尾帧是她在暖金色的海边张臂欢呼。10 秒竖屏,发小红书刚好。

首帧:深夜工位

尾帧:阳光海边
但这里有个大坑:首尾两张图的画风和脸型必须一致。
我第一版翻车了。首帧是日式厚涂写实风,尾帧偏 Q 版大眼卡通风——出来的视频过渡到一半,脸就崩了,从写实脸渐变成大眼娃娃脸,像恐怖片。
第二版我在生图提示词里加了一段硬约束:
CRITICAL character consistency: match reference sheet EXACTLY, same MEDIUM-sized brown eyes, semi-realistic proportions, NOT a big-eyed chibi cartoon.
强制两张图用同一套脸型、同一种画风,再送去做首尾帧——这次过渡丝滑,人物全程一致,闭眼撩发的中间帧还自带治愈感。
适合场景:变身、穿越、前后对比、生长动画。你只需要画好"起点"和"终点"两张图。
局限:首尾图一致性要求高。两张图画风脸型对不上,中间必崩脸。
5Skill技能制造机
前面四种方法,都是"你给指令,AI 执行"。
第五种不一样——你什么都不用说,它自己学。
OiiOii 有个功能叫"技能制造机"。你上传 3-5 条同类视频当样本,它自动分析这些视频的共性——叙事结构、镜头节奏、特效风格、角色设定——然后把这些共性沉淀成一个可复用的"技能"。
以后你调这个技能,它就能批量产同款。
我把灵感素材库里下载的 5 条 AI 足球世界杯燃片喂了进去——有 C 罗救赎的、有哈兰德 vs 姆巴佩的、有佛得角封神的。
它几分钟就学完了,自动造出一个叫"高燃 3D 动漫足球决战"的技能。
我用这个技能生成了一条新的:姆巴佩一记世界波怒射对手球门,15 秒。开头悲情低谷(雨夜半跪流血),中间闪白转场(燃片标准手法),结尾封神爆发(抱臂召唤发光蓝豹图腾)。
写实电影质感,悲情叙事加能量特效,完美复刻了样本片的灵魂。

然后我看到了一个让我愣住的东西。
OiiOii 的 Agent 执行界面上明确写着:"正在使用'高燃 3D 动漫足球决战'技能执行任务,读取该 Skill 的完整 SKILL.md 以获取创作步骤、角色设定、场景设定、风格提示词、执行约束。"

SKILL.md。
我天天在手写的东西。
我手写 skill 教 Claude Code 干活——怎么排版、怎么生图、什么风格、什么约束,全写在 SKILL.md 里。
现在,技能制造机做的事情是:把我喂的 5 条视频,自动写成了一个 SKILL.md。
角色设定、场景设定、风格提示词、执行约束——全自动提取,全自动封装。

然后一个"艺术总监" Agent 读这个 SKILL.md,拆剧本、分镜头、生视频。
殊途同归。我手写的 skill 和它自动生成的 skill,底层是同一个东西。
适合场景:你刷到一类视频觉得"这种风格好棒,我想批量做这种"。不是复刻某一条,是复刻一种风格。
局限:需要 3-5 条高质量样本。样本质量参差不齐,学出来的技能也会乱。
五种方法速查
方法 | 你要给什么 | AI 做什么 | 适合 |
|---|---|---|---|
文生视频 | 一段文字 | 从零生成 | 快速试想法 |
图生视频 | 一张图 | 以图为起点演下去 | 让静图动起来 |
拉片复刻 | 一条参考视频 | 拆结构+替换元素 | 复刻爆款 |
首尾帧 | 两张图 | 补中间过渡 | 看你怎么设计首尾 |
技能制造机 | 3-5 条同类视频 | 自动学风格+批量产 | 批量出片 |
我的选法
两天试完,最大的感受是——难的不是"怎么做",难的是"选哪个"。
我现在的选法很朴素:
想快速验证一个想法,文生视频。想让一张好图动起来,图生视频。想低门槛模仿爆款,拉片复刻。首尾帧的话,你得自己想适合什么场景——我只是拿工位和海边做了个案例,变身、生长、穿越、前后对比都能用。技能制造机适合批量出同类型的片,喂几条样本进去,它帮你把风格固定下来,以后一键产同款。
介绍这么多,希望对大家有所帮助,看教程再多不如亲自动手试一试。