claude-video:让 Claude 真正「看懂」视频的神器,GitHub 单日暴涨近千星

你有没有遇到过这种场景:同事发来一段 5 分钟的 bug 复现录屏,你只能一边拖进度条一边揣测哪里出了问题?或者看到一篇爆款视频,想分析它的开场钩子,但只能凭记忆总结?

今天要介绍的 claude-video,正是解决这些痛点的开源利器。它在 GitHub 上架仅 3 个月就收获 12,000+ Star,今日单日暴涨 988 Stars,热度可见一斑。

什么是 claude-video?

claude-video 是一个让 Claude(以及其他 50+ AI 编程助手)真正”看懂”视频的开源工具。你只需输入一条 /watch 命令加上视频链接和问题,它就会自动下载视频、提取关键帧、获取字幕/音频转录,然后 Claude 基于画面内容给出精准回答——就像它真的看完了整个视频一样。

支持 Claude Code、Codex、Cursor、Copilot、Gemini CLI 等 50+ 开发环境,也支持 claude.ai 网页版。MIT 开源协议,完全免费。

核心功能一览

  • 📹 全平台视频支持:YouTube、TikTok、Loom、Vimeo、Instagram、X(Twitter)等数百个平台,也支持本地视频文件(mp4/mov/mkv/webm)
  • 🎯 智能帧提取:根据视频时长自动计算最优帧预算(30 秒视频 ~30 帧,10 分钟视频 ~80 帧),场景切换检测 + 帧去重,避免重复消耗 token
  • 🎙️ 双轨转录:优先使用免费原生字幕(大部分公开视频自带),无字幕时自动降级到 Whisper API(Groq 或 OpenAI)
  • ⚡ 四种细节模式:transcript(仅字幕,最快)、efficient(关键帧,50 帧上限)、balanced(场景感知,100 帧上限)、token-burner(无上限全量帧)
  • 🔧 零配置开箱即用:首次运行自动检测并提示安装 ffmpeg / yt-dlp / API Key
  • 💰 多数场景免费:公开视频的字幕提取完全免费,Whisper API 仅在无字幕视频时才需要

技术架构亮点

这个项目虽然体量不大(76KB),但设计思路非常精巧:

  • 帧去重算法:将每帧缩放到 16×16 灰度图,计算与前一个保留帧的平均绝对差异,阈值 2.0 以下判定为近似重复并丢弃。与「上一保留帧」而非「前一帧」比较,能有效捕获慢速渐变场景。
  • 场景切换检测:balanced / token-burner 模式下使用 ffmpeg 的 scene 滤镜检测切换点,确保帧预算花在内容变化最大的时刻。
  • 智能帧数分配:根据视频时长自动计算 fps(≤2fps),首尾帧始终保留,确保覆盖完整时间线。
  • 多 Agent 兼容:基于 Agent Skills 标准协议,一套 SKILL.md + scripts 目录即可在 50+ AI Agent 平台通用。
  • Token 经济:默认 512px 帧宽,720p 视频每帧约 197 image tokens。50 帧的 efficient 模式仅耗 ~9.8k tokens,比直接分析全视频节省数百倍。

详细使用步骤

1. 安装

根据你使用的 AI 工具选择安装方式:

# Claude Code(推荐,自动更新)
/plugin marketplace add bradautomates/claude-video
/plugin install watch@claude-video

# Codex / Cursor / Copilot / Gemini CLI 等
npx skills add bradautomates/claude-video -g

# claude.ai 网页版
# 从 Releases 下载 watch.skill → 设置 → 能力 → Skills → 添加

首次运行时会自动检测环境依赖,macOS 自动通过 brew 安装 ffmpeg 和 yt-dlp,Linux/Windows 会打印对应的安装命令。

2. 基本用法

# 分析视频内容
/watch https://youtu.be/dQw4w9WgXcQ 这个视频在讲什么?

# 定位具体时间点
/watch https://youtu.be/xxx --start 2:15 --end 2:45 这段讲了什么?

# 分析本地录屏
/watch ~/Movies/screen-recording.mp4 这个 bug 在什么时候出现的?

3. 高级参数

# 仅字幕模式(零帧,最快)
/watch video.mp4 --detail transcript 总结这个视频

# 高分辨率模式(适合阅读屏幕文字/代码)
/watch video.mp4 --resolution 1024 这段代码的逻辑是什么?

# 指定帧数上限
/watch video.mp4 --max-frames 30 提取关键信息

# 禁用转录(仅看图分析)
/watch video.mp4 --no-whisper 描述视频中的场景

实际应用场景

场景命令示例
Bug 诊断/watch bug-repro.mov 哪里出了问题?
竞品分析/watch 竞品视频 他们用了什么开场钩子?
会议/讲座总结/watch 讲座链接 --detail efficient 总结核心观点
视频笔记/watch 教程视频 总结并生成笔记
内容审核/理解/watch viral-video 实际讲了什么——去掉营销话术
代码审查/watch code-review-recording --resolution 1024 有什么问题?

性能实测数据

以下是针对一段 49 分钟 YouTube 视频(1280×720)的实测表现(不含首次下载的 ~37 秒):

模式帧数提取时间估算 Token
transcript0~4.5s~26.6k(纯文本)
efficient50~0.5s~9.8k
balanced100~20.9s~19.7k
token-burner116~21.0s~22.8k

可以看出 efficient 模式性价比最高:0.5 秒提取 + 不到 1 万 token,就能覆盖 49 分钟视频的全部时间线。

安装前准备

  • 必需:yt-dlp + ffmpeg(首次运行会引导安装)
  • 可选(仅无字幕视频需要):Groq API Key(推荐,更便宜更快)或 OpenAI API Key
  • AI 环境:Claude Code / Codex / Cursor / Copilot / Gemini CLI 等任意一个

总结

claude-video 解决了一个非常实际的痛点:如何让 AI 真正理解视频内容,而不仅仅是读标题和简介。它的设计克制而精准——不过度封装,充分利用 ffmpeg、yt-dlp 等成熟工具,配合精巧的帧提取和去重算法,在 token 消耗和效果之间取得了很好的平衡。

12,000+ Star 的热度也说明市场需求确实存在。如果你经常需要分析视频内容、诊断 bug 录屏、或做竞品内容研究,这个工具绝对值得一试。

开源地址:https://github.com/bradautomates/claude-video

作者 Brad Bonanno 的 YouTube 频道:@bradbonanno

项目协议:MIT License

© 版权声明
THE END
喜欢就支持一下吧
点赞11 分享