最近有个做 AI 工具的朋友问我,Claude Code 能不能直接「看」视频?我以前也这么想过——你粘个视频链接过去,它只能靠标题猜,或者拉一份残缺的转写稿,屏幕上到底发生了什么,其实一无所知。
但今天这个项目,直接把「眼睛」塞给了 Claude。开源三个月,狂揽 1.2 万 Star,顺手把「AI 看视频」这件一直没人做好的事,做成了随手一行命令。
⭐ 1.2 万 Stars(1.2 万星)
📅 开源三个月,加速上涨
📋 MIT 协议,可商用
🔌 50+ 编码平台适配
01
PART
它是什么
WHAT IT DOES
它给 Claude 装了一个 /watch 指令。你丢一个视频链接或本地文件路径,再附一句问题,脚本会先抓字幕、按需下载、抽帧、转写,最后把每一帧当成图片 Read 给 Claude。等它开口回答的时候,是真的「看」过了,而不是「根据标题推测」。
它能干的事,几个典型场景:
🔍 拆解别人的内容
「这个爆款视频开头用了什么钩子?」Claude 看前几帧、读开场转写,把结构拆给你。
🐛 从录屏里找 bug
别人发来一段出问题的录屏,「哪里不对?」它看到出问题的那一帧,往往直接点出原因。
📝 总结 / 去水分
长视频一键总结,或把发布会视频里的实质更新从十分钟铺垫里捞出来。
📚 播单转笔记
跑完一整季,每集一份摘要,频道或课程变成可检索的笔记。
02
PART
项目特点
FEATURES
帧预算
按时长自动决定抽多少帧。30 秒约 30 帧,10 分钟以上封顶 100 帧并提示「sparse scan」,让你改用聚焦模式。烧的是真金白银的 context,这步替你省太多。
帧去重
录屏里一页 PPT 停 90 秒,会抽出一堆几乎一样的帧,每一帧都算钱。它用 16×16 灰度缩略图算平均绝对差,低于 2.0 直接丢,纯标准库实现,不依赖任何图像库。
四档 detail 模式
transcript
只取字幕,约 4.5 秒零下载
efficient
关键帧,约 0.5 秒,快约 40 倍
balanced
场景感知,封顶 100 帧
token-burner
不封顶,长视频也不漏
聚焦模式
--start / --end 只盯某一段,单位时间帧密度更高、token 更省。比如「从第 2 分 15 秒到第 2 分 45 秒发生了什么」。
用完即清
脚本跑完打印工作目录,你不追问就自动删掉临时文件,不留一地鸡毛。
03
PART
能力对照与快速上手
CAPABILITY & SETUP
能力对照
能力 | 需要什么 | 花费 |
|---|---|---|
下载 + 原生字幕 | yt-dlp + ffmpeg | 免费 |
Whisper 兜底(推荐) | Groq key — whisper-large-v3 | 便宜、快 |
Whisper 兜底(备选) | OpenAI key — whisper-1 | 标准价 |
彻底关掉转写 | --no-whisper | 免费 |
快速上手
Claude Code 用户:
...bash
/plugin marketplace add bradautomates/claude-video
/plugin install watch@claude-video
Codex / Cursor / Copilot / Gemini CLI 等 50+ 平台:
...bash
npx skills add bradautomates/claude-video -g
用法:
...bash
/watch https://youtu.be/xxxx what happens at the 30 second mark?
/watch ~/Movies/screen-recording.mp4 when does the UI break?
/watch https://youtu.be/xxxx --start 2:15 --end 2:45
///
LAST
写在最后
CLOSING
Claude 能读网页、跑脚本、翻仓库,唯独「看视频」一直是个缺口。这个项目把那个缺口填上了,而且填得很克制——不贪多抽帧、知道什么时候该聚焦、知道怎么帮你省 token。1.2 万 Star、MIT 协议。如果你日常跟视频打交道,这一下是真的好用十倍。
项目地址:github.com/bradautomates/claude-video