先看结果。
我用 AI 复刻了一条 10 秒左右的服装展示视频:
前几天刷到一条穿搭视频。
两个女生站在衣柜前,没有复杂运镜,也没有什么剧情。就是一套一套换衣服:阔腿牛仔裤配什么上衣,直筒牛仔裤配什么上衣,西装裤又适合什么上衣。
参考视频来自 Max outfits。这里我只放一张来源截图,不搬运原视频。因为这篇文章想讲的是“怎么拆结构、怎么用 AI 做一条自己的版本”,不是把别人的视频重新发一遍。

很简单。
但我看完以后,第一反应是:这条视频特别适合用 AI 复刻。
它的背景不变,机位不变,两个人的位置不变。每一段只改一件事:裤型,或者上衣。
这种视频表面上是在展示衣服,底层其实是一张“搭配公式表”。
我后来按这个逻辑做了一版 AI 复刻。流程跑通以后,我发现真正有用的不是某一句神奇提示词,而是先想清楚:画面里哪些东西必须一直不变,哪些东西可以变化。
1先拆结构,不要急着生成
这条参考视频的结构很清楚:
第一层是固定画面。
两位模特并排站在浅色衣柜前,全身入镜,镜头不动。观众不用理解场景,只看衣服变化。
第二层是搭配公式。
它不是随机换装,而是按裤型分类:
裤型 | 推荐上衣 |
|---|---|
阔腿牛仔裤 | 贴身背心、短款 T、结构感马甲 |
直筒牛仔裤 | 衬衫、基础 T、贴身针织 |
西装长裤 | 剪裁马甲、挺括衬衫、无袖针织、缎面上衣 |
第三层是字幕。顶部英文给公式,底部中文解释。
它厉害的地方不是信息很多,而是信息没有乱。
所以我没有一上来就让 AI “帮我生成一条同款视频”。这种说法太宽了,AI 很容易自己发挥:换人、换背景、换镜头、乱加字幕。
我把任务拆成了四步:
1.先定两个人物。
2.再定两个人同框的标准合照。
3.每套衣服生成一张静态参考图,也就是视频里的“关键帧”。
4.最后用视频工具让这些参考图动起来。
听起来绕,但比直接生成省事。AI 视频最怕的不是不会动,是动起来以后什么都跟着变。
2第一步,先锁人物
如果你要做的是连续视频,人物不能只靠一句“两个年轻女生”。这句话对 AI 来说太松了。第一段是这个脸,第二段可能就换了五官;第一张两个人差不多高,下一张突然一个高很多。
更严格的做法,是先给每个人做三视图。但这次做下来我发现,对于这种双人穿搭展示视频,最关键的不是把每个人的正侧背都做完,而是先做一张稳定的双人标准合照。
这张合照要告诉后面的模型:这两个人是谁,谁站左边,谁站右边,两个人差不多多高,背景是什么,镜头距离是多少。

这一张负责锁住几件事:
•两个人身高接近
•A 永远在左边,B 永远在右边
•背景是同一面白色衣柜
•全身入镜
•包、鞋、发型这些小细节尽量固定
服装视频里的人物一致性,很多时候不是靠视频阶段救回来的,而是在“标准合照”里先定住的。标准合照不稳,后面每换一次衣服,都会多一次漂移机会。
3第二步,一次只换一个东西
人物定好以后,才开始做每一套衣服的参考图。
这里我没有让 AI 自由发挥“多做几套时髦穿搭”,而是按参考视频的结构,拆成 6 张图:
1.阔腿牛仔裤 + 贴身背心
2.阔腿牛仔裤 + 短款 T
3.阔腿牛仔裤 + 结构感马甲
4.直筒牛仔裤 + 衬衫
5.直筒牛仔裤 + 基础 T
6.直筒牛仔裤 + 贴身针织
每张图都沿用同一张双人标准合照,只改衣服。这样 AI 会更容易理解:人不要变,背景不要变,只是换搭配。

这一步有一个很朴素的原则:不要同时改太多东西。背景不要改,站位不要改,镜头距离不要改,人物关系不要改。只改“这条裤子配哪件上衣”。
服装视频本来讲的就是搭配关系。如果背景和人物一直乱跳,观众看见的就不是搭配,而是 AI 的不稳定。
动作也要提前想好。不是让两个人站着当模特,而是让她们有“展示衣服”的动作:摸裤腰、拉衣摆、指裤型、抚平衬衫门襟、整理马甲下摆。
这些动作很小,但很重要。它会让画面从“摆拍照片动了一下”,变成“两个人正在介绍衣服”。
4第三步,视频提示词要写成完整 15 秒
6 张参考图准备好以后,我没有把 6 段完全分开做。我更倾向于给视频工具一个完整任务:
生成一个 15 秒竖屏服装展示视频。 分成 6 个连续分镜,每个约 2.5 秒。 顺序严格对应 6 张参考图。 两位女生在白色衣柜前固定全身机位展示穿搭。 两个女生必须自己用英文对话介绍衣服,不要旁白。 需要看到开口说话、互相交流,以及摸衣服、拉衣摆、摸裤腰、指裤型、抚平上衣等动作。 保持人物身份、身高、发型、站位和背景一致。
这里有两个点要写死。第一,必须是两个女生自己说话,不是旁白。
服装展示类视频里,说话的人和展示衣服的人最好是同一个。否则画面会像广告素材,缺少真人种草感。
第二,动作要围绕衣服。“自然动作”太宽泛。AI 可能让人物挥手、点头、微笑,但这些动作和衣服没关系。要明确写“摸裤腰”“拉衣摆”“指裤型”。
最终用 AI 视频工具生成的视频有 15 秒左右,人物站位比较稳,也有音轨和开口动作。这一步不追求完美真人级口型。我的标准是:观众能感觉到她们在交流,动作和衣服有关,人物不要跳戏。
5第四步,字幕和剪辑后期做
AI 视频里最不该交给模型硬生成的东西,是字幕,尤其是中文。参考视频的字幕结构很好:顶部英文,底部中文。这个可以后期做,不要让视频模型直接画字。
我最后把成片放进 ChatCut,做了两件事:
第一,剪掉第一个不需要的镜头。
第二,加一层双语字幕。顶部是英文搭配公式,底部是中文解释,白字加灰色描边,和参考视频的阅读方式接近。
如果你不用 ChatCut,用剪映也一样。
这一步没有什么神秘操作,本质就是普通剪辑:
1.把 AI 生成的视频拖进去。
2.不要的开头剪掉。
3.顶部加英文字幕。
4.底部加中文字幕。
5.导出竖屏视频。
这里的字幕不是为了装饰,而是在帮观众快速读懂“这一段看什么”。比如:
Pair them with fitted tanks or basic tees. 搭配贴身背心或基础 T 恤。
视频画面负责展示,字幕负责归纳。口播一长,视频就变慢;字幕太花,衣服又看不清。最舒服的状态是:画面给例子,字幕给公式。
6一张流程图讲完
这件事最后可以压成一张图:

我觉得这张图比再写一大段步骤更有用。
因为它提醒的是顺序:先确定什么不变,再去制造变化。不要把“人物一致、衣服变化、动作展示、字幕准确”全塞给视频模型一次完成。
每个环节只负责一件事,出问题也好改:
人物不像,就回到标准合照。 身高不对,就重做标准合照。 衣服不连贯,就重出那一张参考图。 动作不够展示感,就加强视频提示。 字幕不准,就在 ChatCut 或剪映里改。
剪辑工具不用纠结。会用 ChatCut 就用 ChatCut,会用剪映就用剪映。这里真正重要的是:视频模型负责生成画面,剪辑工具负责处理文字和取舍。
7我最后学到的
以前我会把 AI 视频理解成“把提示词写好,然后等它生成”。做完这条服装视频以后,我的感觉变了。
"
AI 视频更像是在做一条小产线。

先拆模板,再定角色,再定参考图,再让画面动起来,最后用剪辑把信息补齐。
服装视频尤其适合这个方法,因为它本来就是“控制变化”的游戏。好看的穿搭视频,不是每一帧都新鲜,而是观众知道自己在比较什么。
同一个背景,同两个人,同一个机位,一次只换一件衣服。
越稳定,越容易看出变化。
AI 复刻也是一样。真正要复刻的不是某个女生、某条裤子,也不是某一句英文字幕。
要复刻的是它的结构:把复杂的审美判断,变成一眼能看懂的搭配公式。
这才是这类视频最值钱的地方。
我这版没有复刻原作者的人物和衣服,只复刻了它的内容结构:固定背景、双人展示、按裤型换上衣、顶部英文、底部中文。
原视频版权归原作者所有,本文只做视频结构拆解与 AI 制作方法分享。