首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >复刻外网爆款穿搭视频:我摸清了AI视频稳定出片的底层逻辑

复刻外网爆款穿搭视频:我摸清了AI视频稳定出片的底层逻辑

作者头像
月鹿造物
发布2026-09-08 21:32:23
发布2026-09-08 21:32:23
250
举报

先看结果。

我用 AI 复刻了一条 10 秒左右的服装展示视频:

前几天刷到一条穿搭视频。

两个女生站在衣柜前,没有复杂运镜,也没有什么剧情。就是一套一套换衣服:阔腿牛仔裤配什么上衣,直筒牛仔裤配什么上衣,西装裤又适合什么上衣。

参考视频来自 Max outfits。这里我只放一张来源截图,不搬运原视频。因为这篇文章想讲的是“怎么拆结构、怎么用 AI 做一条自己的版本”,不是把别人的视频重新发一遍。

很简单。

但我看完以后,第一反应是:这条视频特别适合用 AI 复刻。

它的背景不变,机位不变,两个人的位置不变。每一段只改一件事:裤型,或者上衣。

这种视频表面上是在展示衣服,底层其实是一张“搭配公式表”。

我后来按这个逻辑做了一版 AI 复刻。流程跑通以后,我发现真正有用的不是某一句神奇提示词,而是先想清楚:画面里哪些东西必须一直不变,哪些东西可以变化。

1先拆结构,不要急着生成

这条参考视频的结构很清楚:

第一层是固定画面。

两位模特并排站在浅色衣柜前,全身入镜,镜头不动。观众不用理解场景,只看衣服变化。

第二层是搭配公式。

它不是随机换装,而是按裤型分类:

裤型

推荐上衣

阔腿牛仔裤

贴身背心、短款 T、结构感马甲

直筒牛仔裤

衬衫、基础 T、贴身针织

西装长裤

剪裁马甲、挺括衬衫、无袖针织、缎面上衣

第三层是字幕。顶部英文给公式,底部中文解释。

它厉害的地方不是信息很多,而是信息没有乱。

所以我没有一上来就让 AI “帮我生成一条同款视频”。这种说法太宽了,AI 很容易自己发挥:换人、换背景、换镜头、乱加字幕。

我把任务拆成了四步:

1.先定两个人物。

2.再定两个人同框的标准合照。

3.每套衣服生成一张静态参考图,也就是视频里的“关键帧”。

4.最后用视频工具让这些参考图动起来。

听起来绕,但比直接生成省事。AI 视频最怕的不是不会动,是动起来以后什么都跟着变。

2第一步,先锁人物

如果你要做的是连续视频,人物不能只靠一句“两个年轻女生”。这句话对 AI 来说太松了。第一段是这个脸,第二段可能就换了五官;第一张两个人差不多高,下一张突然一个高很多。

更严格的做法,是先给每个人做三视图。但这次做下来我发现,对于这种双人穿搭展示视频,最关键的不是把每个人的正侧背都做完,而是先做一张稳定的双人标准合照。

这张合照要告诉后面的模型:这两个人是谁,谁站左边,谁站右边,两个人差不多多高,背景是什么,镜头距离是多少。

双人标准合照:固定身高、站位和背景
双人标准合照:固定身高、站位和背景

这一张负责锁住几件事:

两个人身高接近

A 永远在左边,B 永远在右边

背景是同一面白色衣柜

全身入镜

包、鞋、发型这些小细节尽量固定

服装视频里的人物一致性,很多时候不是靠视频阶段救回来的,而是在“标准合照”里先定住的。标准合照不稳,后面每换一次衣服,都会多一次漂移机会。

3第二步,一次只换一个东西

人物定好以后,才开始做每一套衣服的参考图。

这里我没有让 AI 自由发挥“多做几套时髦穿搭”,而是按参考视频的结构,拆成 6 张图:

1.阔腿牛仔裤 + 贴身背心

2.阔腿牛仔裤 + 短款 T

3.阔腿牛仔裤 + 结构感马甲

4.直筒牛仔裤 + 衬衫

5.直筒牛仔裤 + 基础 T

6.直筒牛仔裤 + 贴身针织

每张图都沿用同一张双人标准合照,只改衣服。这样 AI 会更容易理解:人不要变,背景不要变,只是换搭配。

6 张服装关键帧:同背景同人物,只换搭配
6 张服装关键帧:同背景同人物,只换搭配

这一步有一个很朴素的原则:不要同时改太多东西。背景不要改,站位不要改,镜头距离不要改,人物关系不要改。只改“这条裤子配哪件上衣”。

服装视频本来讲的就是搭配关系。如果背景和人物一直乱跳,观众看见的就不是搭配,而是 AI 的不稳定。

动作也要提前想好。不是让两个人站着当模特,而是让她们有“展示衣服”的动作:摸裤腰、拉衣摆、指裤型、抚平衬衫门襟、整理马甲下摆。

这些动作很小,但很重要。它会让画面从“摆拍照片动了一下”,变成“两个人正在介绍衣服”。

4第三步,视频提示词要写成完整 15 秒

6 张参考图准备好以后,我没有把 6 段完全分开做。我更倾向于给视频工具一个完整任务:

生成一个 15 秒竖屏服装展示视频。 分成 6 个连续分镜,每个约 2.5 秒。 顺序严格对应 6 张参考图。 两位女生在白色衣柜前固定全身机位展示穿搭。 两个女生必须自己用英文对话介绍衣服,不要旁白。 需要看到开口说话、互相交流,以及摸衣服、拉衣摆、摸裤腰、指裤型、抚平上衣等动作。 保持人物身份、身高、发型、站位和背景一致。

这里有两个点要写死。第一,必须是两个女生自己说话,不是旁白。

服装展示类视频里,说话的人和展示衣服的人最好是同一个。否则画面会像广告素材,缺少真人种草感。

第二,动作要围绕衣服。“自然动作”太宽泛。AI 可能让人物挥手、点头、微笑,但这些动作和衣服没关系。要明确写“摸裤腰”“拉衣摆”“指裤型”。

最终用 AI 视频工具生成的视频有 15 秒左右,人物站位比较稳,也有音轨和开口动作。这一步不追求完美真人级口型。我的标准是:观众能感觉到她们在交流,动作和衣服有关,人物不要跳戏。

5第四步,字幕和剪辑后期做

AI 视频里最不该交给模型硬生成的东西,是字幕,尤其是中文。参考视频的字幕结构很好:顶部英文,底部中文。这个可以后期做,不要让视频模型直接画字。

我最后把成片放进 ChatCut,做了两件事:

第一,剪掉第一个不需要的镜头。

第二,加一层双语字幕。顶部是英文搭配公式,底部是中文解释,白字加灰色描边,和参考视频的阅读方式接近。

如果你不用 ChatCut,用剪映也一样。

这一步没有什么神秘操作,本质就是普通剪辑:

1.把 AI 生成的视频拖进去。

2.不要的开头剪掉。

3.顶部加英文字幕。

4.底部加中文字幕。

5.导出竖屏视频。

这里的字幕不是为了装饰,而是在帮观众快速读懂“这一段看什么”。比如:

Pair them with fitted tanks or basic tees. 搭配贴身背心或基础 T 恤。

视频画面负责展示,字幕负责归纳。口播一长,视频就变慢;字幕太花,衣服又看不清。最舒服的状态是:画面给例子,字幕给公式。

6一张流程图讲完

这件事最后可以压成一张图:

AI 视频稳定出片流程图
AI 视频稳定出片流程图

我觉得这张图比再写一大段步骤更有用。

因为它提醒的是顺序:先确定什么不变,再去制造变化。不要把“人物一致、衣服变化、动作展示、字幕准确”全塞给视频模型一次完成。

每个环节只负责一件事,出问题也好改:

人物不像,就回到标准合照。 身高不对,就重做标准合照。 衣服不连贯,就重出那一张参考图。 动作不够展示感,就加强视频提示。 字幕不准,就在 ChatCut 或剪映里改。

剪辑工具不用纠结。会用 ChatCut 就用 ChatCut,会用剪映就用剪映。这里真正重要的是:视频模型负责生成画面,剪辑工具负责处理文字和取舍。

7我最后学到的

以前我会把 AI 视频理解成“把提示词写好,然后等它生成”。做完这条服装视频以后,我的感觉变了。

"

AI 视频更像是在做一条小产线。

先固定人和场景,再一套一套换衣服
先固定人和场景,再一套一套换衣服

先拆模板,再定角色,再定参考图,再让画面动起来,最后用剪辑把信息补齐。

服装视频尤其适合这个方法,因为它本来就是“控制变化”的游戏。好看的穿搭视频,不是每一帧都新鲜,而是观众知道自己在比较什么。

同一个背景,同两个人,同一个机位,一次只换一件衣服。

越稳定,越容易看出变化。

AI 复刻也是一样。真正要复刻的不是某个女生、某条裤子,也不是某一句英文字幕。

要复刻的是它的结构:把复杂的审美判断,变成一眼能看懂的搭配公式。

这才是这类视频最值钱的地方。

我这版没有复刻原作者的人物和衣服,只复刻了它的内容结构:固定背景、双人展示、按裤型换上衣、顶部英文、底部中文。

原视频版权归原作者所有,本文只做视频结构拆解与 AI 制作方法分享。

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-21,如有侵权请联系 cloudcommunity@tencent.com 删除
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档