# video-use:用 AI 编程助手直接剪辑视频的 GitHub 热门项目
扔一文件夹原始素材进去,跟 Claude Code 说一句”剪成宣传片”,它就自己把废话剪掉、调色、加字幕、贴动画,最后吐给你一个 `final.mp4` —— 这就是今天 GitHub 上爆火的开源项目 **video-use**(22,000+ Star)。
项目是什么?
**video-use** 是知名自动化项目 **browser-use** 团队推出的开源工具,理念一句话概括:**用代码智能体(Coding Agent)来剪视频**。它 100% 开源,主推配合 Claude Code 使用,也兼容 Codex、Hermes、Openclaw 等任何能跑 shell 的 AI 智能体。
传统视频剪辑靠的是 Premiere / 剪映这种图形界面和一堆预设模板;video-use 反其道而行——不给你菜单,让你像跟人聊天一样,把一堆原始素材丢进文件夹,然后用一句话告诉 AI 你想要的效果,剩下的交给它。
**项目地址**:https://github.com/browser-use/video-use
它有什么用?
video-use 能替你完成剪辑工作中最烦人的那部分:
- **自动剪掉废话**:`umm`、`uh`、口误、两句话之间的死寂停顿,全部自动识别并切除
- **自动调色**:暖色调电影感、中性鲜明、或任意自定义的 ffmpeg 调色链,逐段应用
- **平滑淡入淡出**:每个剪切点自动加上 30ms 音频淡入淡出,杜绝爆音
- **字幕随心烧制**:默认 2 词大写样式,可完全自定义
- **自动生成动画**:通过 HyperFrames、Remotion、Manim 或 PIL 生成动画叠加层,每个动画由并行子智能体独立渲染
- **渲染自检**:在给你看预览之前,AI 会在每个剪切点自己检查渲染结果(画面跳变、爆音、字幕被挡住都会发现)
- **记忆会话**:把状态写进 `project.md`,下次打开接着上次的进度继续
无论你是做口播、混剪、教程、旅行 vlog 还是访谈,都能用上——**不需要任何预设或模板**,它零假设地”先看内容再决定怎么剪”。
它的核心思路:AI 不”看”视频,而是”读”视频
这是 video-use 最巧妙的设计。它不让 AI 一帧一帧看画面(那样 3 万帧 × 每个 1500 token = **4500 万 token 的海量噪声**),而是用两层结构给 AI 精简但完整的”读图”视角:
- **第一层 · 音频文本**:每个素材用一次 ElevenLabs Scribe 转写,得到**词级时间戳**、说话人分离、以及 `(笑声)`、`(掌声)` 这类音频事件。所有素材打包进一个只有 ~12KB 的 `takes_packed.md`,这就是 AI 的主要”阅读视图”。
- **第二层 · 视觉合成图**:配合一个 `timeline_view` 工具,按需生成”胶片带 + 声波 + 词标签”的合成图,只在 AI 需要判断模糊停顿、对比不同 take、核对剪切点时调用。
**打个比方**:就像 browser-use 给 AI 一个结构化的 DOM 而不是网页截图一样,video-use 给 AI 一份结构化的”时间轴文本”而不是压垮上下文的原始视频帧。
怎么安装?
一、智能安装(推荐,让 AI 自己装)
把下面这段提示词粘贴给 Claude Code / Codex / Hermes / Openclaw 等任何有 shell 权限的智能体:
Set up https://github.com/browser-use/video-use for me.
Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.
它会自动帮你克隆仓库、装依赖、注册技能,并只在你需要时向你要一次 ElevenLabs API key(在 [elevenlabs.io/app/settings/api-keys](https://elevenlabs.io/app/settings/api-keys) 申请)。
二、手动安装
# 1. 克隆并软链到智能体的技能目录
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use # Codex
# 2. 安装依赖
cd ~/Developer/video-use
uv sync # 或者: pip install -e .
brew install ffmpeg # 必需
brew install yt-dlp # 可选,用于下载在线素材
# 3. 配置 ElevenLabs API key
cp .env.example .env
$EDITOR .env # ELEVENLABS_API_KEY=...
怎么使用?
装好之后,进入存放素材的文件夹,启动你的智能体:
cd /path/to/your/videos
claude # 或 codex、hermes 等
然后在会话里直接说:
edit these into a launch video
AI 会先盘点素材、给出剪辑策略、**等你确认后再动手**,最后在你素材旁边生成 `edit/final.mp4`。所有输出都放在 `
支持通过 Browser Use Box 在自建 VPS 或 Telegram 上做”常驻剪辑”,随时远程丢素材让它干活。
设计原则(它凭什么剪得好)
1. **文本 + 按需视觉**:不 dump 帧,以文本转写为主界面
2. **音频优先,视觉跟随**:剪切点基于语音边界和静音间隙,而不是画面
3. **询问 → 确认 → 执行 → 自检 → 沉淀**:没有得到策略批准绝不动刀
4. **对内容类型零假设**:先看,先问,再剪
5. **12 条硬规则,别处自由发挥**:成片正确性没得商量,审美品味交给 AI
总结
**video-use 的价值在于”把剪辑的门槛也降下来了”。** 过去剪视频是图形软件 + 模板的天下,现在它证明了:只要给 AI 一份结构化的”时间轴文本”和按需的视觉参考,它就能像专业剪辑师一样完成从粗剪到成品的一整套流程——而且全程用自然语言沟通。
**适合谁用?**
- ❗ **做口播/视频号的创作者**:自动剪废话、自动调色加字幕,省下大把时间
- ❗ **程序员 / 技术博主**:本身就是开源的 coding-agent 项目,想二次开发完全透明
- ❗ **任何不熟悉专业剪辑软件的人**:不需要学 PR/剪映,一行提示词就能出片
- ❗ **对 AI 应用感兴趣的人**:它”用文本代替帧”的思路,本身就是一份绝佳的 AI 工程示范
**一句话评价**:当我们还在纠结”AI 能不能看懂视频”时,video-use 已经聪明地绕开了这个问题——**它不让 AI 看视频,而是让它读视频**。用 12KB 文本替代 4500 万 token 的帧信息,这种”降维打击”式的思路,比它剪出来的视频本身还要精彩。
—
**项目信息:**
- 项目地址:https://github.com/browser-use/video-use
- 协议:MIT(完全免费开源)
- 语言:Python
- Stars:22,000+
- 出品方:browser-use(知名浏览器自动化开源团队)
- 依赖:ffmpeg(必需)、ElevenLabs API key(转写用)















暂无评论内容