如何用claude-video分析一个TikTok视频:完整新手教程
【免费下载链接】claude-videoGive Claude the ability to watch any video. /watch downloads, extracts frames, transcribes, hands it all to Claude.项目地址: https://gitcode.com/GitHub_Trending/cl/claude-video
Claude 能读网页、跑脚本、看代码仓库,但天生不会"看视频"。开源项目claude-video正好补上这个缺口:一条/watch命令,就能自动下载任意视频、提取关键帧、生成带时间戳的字幕稿,然后让 Claude 像真人"看过"视频一样回答你的问题。本教程带你用 claude-video 从零开始分析一个 TikTok 视频,全程无需任何配置经验。
一、claude-video 是什么?为什么值得装
平时把视频链接丢给大模型,它只能靠标题瞎猜,或者找一份缺失了 90% 信息的文字稿。claude-video 的思路完全不同:
- 下载:用 yt-dlp 把视频拉下来(支持 TikTok、YouTube、X、Instagram、Loom、Vimeo 等几百个平台,也支持本地
.mp4、.mov文件) - 抽帧:用 ffmpeg 按视频时长自动决定抽帧密度,帧率上限 2fps、帧数上限 100 帧
- 转写:优先抓取平台原生字幕(免费),没有字幕时再调用 Whisper API 转录音频
- 回答:Claude 逐帧读取图片 + 对照带时间戳的字幕,给出"亲眼见过"的答案
它的核心入口是一个技能脚本SKILL.md,真正的流水线由scripts/watch.py串联完成:下载(scripts/download.py)、抽帧(scripts/frames.py)、转写(scripts/transcribe.py)、Whisper 客户端(scripts/whisper.py)、环境自检与安装(scripts/setup.py)。
二、安装 claude-video:三种最快配置方法
根据你的使用环境任选其一:
方法 1:Claude Code 插件(推荐)
在 Claude Code 里依次执行两条命令:
/plugin marketplace add bradautomates/claude-video /plugin install watch@claude-video之后升级只需/plugin update watch@claude-video。
方法 2:claude.ai 网页版
从项目的 release 页面下载watch.skill文件,进入 Settings → Capabilities → Skills,点+上传。注意:必须先开启 Capabilities 里的"Code execution and file creation",否则技能无法调用 ffmpeg 和 yt-dlp。
方法 3:手动克隆(开发者)
git clone https://gitcode.com/GitHub_Trending/cl/claude-video ~/.claude/skills/watch💡零配置启动:首次运行/watch时,内置的scripts/setup.py --check会自动检查环境——macOS 直接帮你brew install ffmpeg yt-dlp,Linux / Windows 则打印出对应apt、winget等精确命令。后续每次检查不到 100ms,完全无感。
三、第一次 /watch:环境自检会做什么
首次调用/watch时会自动走一遍预检:
| 情况 | 自动处理 |
|---|---|
| 缺少 ffmpeg / yt-dlp | 自动安装(macOS)或打印安装命令(Linux/Windows) |
| 没有 Whisper API Key | 自动创建~/.config/watch/.env(权限 0600),并引导你填入 Groq 或 OpenAI 的 Key |
| 一切就绪 | 静默通过,不打印任何废话 |
不想配 Key 也没关系——加上--no-whisper参数即可纯免费使用,只是无字幕的视频会退化为"只看画面、不听声音"。
四、三步分析一个 TikTok 视频
第 1 步:粘贴链接 + 你的问题
/watch https://www.tiktok.com/@user/video/123 summarize this也可以直接提问,比如:
/watch https://www.tiktok.com/@user/video/123 what happens at the 30 second mark?第 2 步:后台自动执行(你什么都不用做)
- yt-dlp 把视频下载到临时工作目录
- ffmpeg 按时长自动抽帧:30 秒内的短视频约抽 30 帧,1–3 分钟约 60 帧,每帧默认 512px 宽的 JPEG
- 拉取原生字幕;TikTok 视频通常没有字幕轨,脚本会提取 16kHz 单声道音频,交给 Whisper(Groq 的
whisper-large-v3优先,更便宜更快;OpenAI 的whisper-1兜底) - 脚本输出所有帧的路径(带
t=MM:SS时间标记)+ 带时间戳的字幕稿
第 3 步:拿到"看过视频"的回答
Claude 会并行读取每一帧,结合字幕作答。它回答的依据是真实的画面和音频,会引用具体时间点,比如"0:03 时屏幕上出现……"。追问时直接继续问即可,无需重新跑脚本——帧和字幕还在上下文里。
五、为什么 TikTok 视频特别需要 Whisper Key
这一点新手容易忽略:
- YouTube 等平台的公开视频大多带免费原生字幕,yt-dlp 直接抓取即可
- TikTok 基本没有字幕轨,本地文件也都没有,所以都会走 Whisper 兜底
- Groq Key 便宜且快(推荐),OpenAI Key 按标准价计费;两个 Key 都写在
~/.config/watch/.env - Whisper 上传上限 25MB,约合 50 分钟音频;更长的内容需要用下面的分段参数
六、进阶技巧:让长视频分析更准更省
🎯 聚焦模式--start/--end:当你只关心某一段(比如"2:30 左右发生了什么"),传这两个参数后脚本会切换到更密的抽帧预算(5–15 秒可跑到 2fps),字幕也自动裁剪到同一区间。比全文稀疏扫描有用得多,还省 token:
/watch "$URL" --start 2:15 --end 2:45其他常用参数:
--resolution 1024:需要读屏上文字(幻灯片、代码、评论区)时把帧宽从 512 提到 1024--max-frames N:压低帧数上限,收紧 token 预算--whisper groq|openai:强制指定 Whisper 后端--no-whisper:彻底关闭转写,纯看帧--out-dir DIR:指定工作文件保存位置
抽帧预算一览(帧数是 token 消耗的大头):
| 视频时长 | 默认抽帧数 | 效果 |
|---|---|---|
| ≤ 30 秒 | 约 30 帧 | 密集,几乎覆盖每个关键瞬间 |
| 30 秒–1 分钟 | 约 40 帧 | 仍然密集 |
| 1–3 分钟 | 约 60 帧 | 舒适 |
| 3–10 分钟 | 约 80 帧 | 稀疏但可用 |
| > 10 分钟 | 100 帧 | 出现"稀疏扫描"警告 |
10 分钟以上的视频会提示精度下降,正确做法是用
--start/--end重跑你真正关心的片段。
七、新手常见问题 FAQ
- 下载失败?视频需要登录或地区受限时,yt-dlp 拿不到,
/watch也拿不到——它不做任何账号登录,只支持公开链接和本地文件。 - Windows 用户注意:Windows 上要写
python而不是python3(后者是微软商店的占位程序,跑不了脚本)。 - 没有字幕又没有 Key?回答只有画面没有声音,脚本会明确提示,可后续补配 Key。
- 隐私如何?视频文件本身不会上传到任何 API,只有在缺字幕且未禁用 Whisper 时,才会上传提取出的音频片段;Groq 的 Key 只发往 Groq,OpenAI 的 Key 只发往 OpenAI。
八、总结
claude-video 用一条/watch命令,把"看视频"这个大模型最缺的能力补齐了:yt-dlp 下载、ffmpeg 抽帧、字幕/Whisper 转写,最后交给 Claude 逐帧作答。分析一个 TikTok 视频只需要粘贴链接加一个问题,10 分钟内视频效果最佳,更长内容用--start/--end聚焦即可。现在就去装一个,把你的第一个视频链接丢给它吧 ✅
【免费下载链接】claude-videoGive Claude the ability to watch any video. /watch downloads, extracts frames, transcribes, hands it all to Claude.项目地址: https://gitcode.com/GitHub_Trending/cl/claude-video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考