anything2explainer:给 AI 编程助手装上「讲解视频」技能,输入主题就出一条带配音字幕的讲解片
在 GitHub 上,把「文字变视频」这件事做出来的项目很多,但大多要么调用生成式视频模型赌像素,要么只是一个 CLI 工具。anything2explainer 走的是另一条路:它不是一个工具,而是一整套「方法」——一套让 AI 编程助手(Claude Code / Codex)能够独立完成一部讲解视频的技能包。
你只需要给它一个主题,比如「讲一下向量数据库」,它就会自己调研、写旁白、配音、画分镜、并行写代码渲染,最后交付一条 1280×720 的 MP4:带 TTS 配音、逐词对齐字幕、章节卡片和底部章节进度条,全程每一帧都是用代码画出来的,没有任何一帧来自别处。
这个项目 2026 年 9 月 8 日建仓,几天内就冲到 900+ star,是目前「AI Agent 做视频」方向里少见的、把完整方法论都开源出来的作品。
• 项目地址:github.com/Vincentwei1021/anything2explainer
它到底是什么:不是工具,是一整套做片子的方法
作者在 README 里反复强调一句话:It is not a CLI.(这不是一个命令行工具)。
它真正交付的东西是:一个可直接编译的 Remotion 模板、一套图元与光照库、配音/分镜/渲染/量化质检的工具脚本、写好的风格与运动规范、一套多智能体分工协议,以及一部完整的参考影片作为质量标尺。
输入是「一个主题(或一篇文章 / 文档)+ 时长 + 语言」,输出是「一条 1280×720 的 H.264 MP4 + 全套过程文档」——调研稿(含来源链接)、旁白稿、分镜表、每个镜头的源码、质检报告。整条流水线大约 1 到 3 小时,其中大部分时间都是多个智能体在并行地画镜头。
九个阶段,四个检查点
整个流程写在 SKILL.md 里,共九个阶段:搭脚手架 → 调研 → 旁白与时间轴 → 分镜 → 叠加层与图元 → 先导片(60 秒试看)→ 并行构建 → 渲染 → 质检与修复。
其中最值得说的一点,是它只在四个检查点停下来等你拍板,而不是一路闷头做完:
1. 时长与语言:在写脚本前确定。时长决定行数、镜头数和并行智能体的数量——也就是这部片子到底能讲多深;语言会切换 src/config.ts 里的 lang 字段,连带排版、字幕预算和默认音色一起变。
2. 旁白定稿:在配音之前。一旦锁定,帧号就被硬编码进每个镜头,改一个字就要重新对整条片子计时。这是最便宜的干预点。
3. 配音:问你要不要指定 TTS 引擎。不指定就用默认(中文 edge-tts 云希,英文 kokoro-82m Liam)。你也可以自己交一段成片音频,手动填每行的时间轴。
4. 先 30 秒:只做完第一个镜头组,先渲染 30 秒给你看效果。在这里改风格只花一个组的成本,等全片渲染完再改,就是每个组都要返工。
输出规格与时长档位
| 项目 | 规格 |
| 画面 / 帧率 | 1280×720 @ 30fps,H.264 |
| 时长 | 2–8 分钟均可 |
| 语言 | 中文或英文(lang 字段),排版、字幕预算、默认音色随之切换 |
| 视觉 | 黑底画布 + 星空雾渐变 或 点阵波(bg 字段);白色线稿 + 紫色点缀,超粗标题字 |
| 常驻图层 | 44px 白字黑描边字幕、底部章节进度条、顶部胶囊 HUD |
| 配音 | 中文 edge-tts 云希 / 英文 kokoro-82m Liam,或自带 TTS |
时长直接决定整条流水线的规模:
| 时长 | 中文字数 | 英文词数 | 镜头数 | 构建智能体 | 墙钟时间 |
| 2–3 分钟 | 700–950 | 280–420 | 24–32 | 4–6 | 约 1 小时 |
| 3–5 分钟(参考档) | 1200–1500 | 420–700 | 40–50 | 8 | 约 2 小时 |
| 5–8 分钟 | 1800–2400 | 700–1150 | 60–80 | 10–14 | 约 2–3 小时 |
每一帧都是代码画出来的,每一个数字都有出处
这个项目最有意思的地方在于它把「可复现」和「可溯源」当成了硬性要求。
每一帧都画在代码里。 没有一帧来自现有视频,没有生成式视频模型,也没有从任何人作品里截的帧。所有动画都是帧号的纯函数,随机数带种子,文本适配是算出来的而不是在 DOM 里量的——所以重新渲染会得到完全一致的帧。想改某一帧?改那一个镜头文件就行。
每一个事实都能溯源。 屏幕上出现的每个数字、年份、机构和英文术语,都必须能在该片的调研文档里找到对应的来源 URL。任何没核实过的东西,既不上屏也不进旁白。项目还单独声明了原创性:可选的实拍 B-roll 必须来自免版权来源,并在 MANIFEST 里登记 sha256、来源 URL、许可和用途。
先讲风格,再讲画面
在动手画之前,这个技能会先写好两套规范,所有镜头都只能使用其中的「词汇」:
• 风格规范 reference/style-guide.md:安全区、调色板、字体、图元目录、排版习惯;
• 运动词汇表 reference/motion-vocabulary.md:入场/强调/光照/退场/镜头运动的公式和帧数。
整个项目只有一种视觉风格,并且刻意只留一个开关:背景是 bg: 'stars' 还是 bg: 'dots'。想改别的,就得去动 reference/style-guide.md 和 src/ui.tsx——因为镜头代码只调用这些基础图元。
这种设计的好处是,几千帧的画面能保持高度统一,而不会越做越花。
不是演示,是真有参考影片
仓库里带着一部完整的参考影片:《RAG 与知识库》,中文版 4 分 54 秒,44 行 / 1490 字,点阵波背景;英文版 *RAG & Knowledge Bases* 5 分 02 秒,44 行 / 785 词。两版共用同一个分镜和 44 个镜头,英文版为英文旁白重新对时。
更有价值的是 examples/rag/ 目录里保留了整条「纸面痕迹」:从调研稿、旁白、分镜,到每个镜头的源码、质检报告和交付说明。原始中文版是 4 分 35 秒、星空背景,由 8 个构建智能体并行跑了 40 分钟,经历两轮质检产出。
examples/contrast/ 里还放了 6 组「坏/好」对比帧,作为构图与光照的标尺——这比任何文字规范都直观。
和其他方案的区别
| 工具类型 | 它产出什么 | anything2explainer 的不同 |
| 生成式视频模型(Sora、Veo、Runway) | 由提示词合成的画面 | 确定性代码,不是像素。屏幕上的每个数字都能追溯到来源 URL,任何一帧都能靠改一个镜头文件修好 |
| 数字人 / 口播工具(HeyGen、Synthesia) | 一个念稿的虚拟主播 | 没有主播。用动态图形图解机制,旁白驱动画面 |
| 手写 Remotion 或 Motion Canvas | 一块可编程的视频画布 | 在画布之上交付了整套方法:调研 → 旁白 → 分镜 → 并行构建 → 质检,附带风格规范、运动词汇和参考影片 |
| Manim | Python 数学动画 | 智能体驱动的端到端流水线,带 TTS 对齐字幕、章节和质检;用 React / TypeScript 而非 Python |
安装与使用
安装就是克隆加软链接,让它成为 Claude Code / Codex 的技能:
git clone https://github.com/Vincentwei1021/anything2explainer.git
ln -s "$PWD/anything2explainer" ~/.claude/skills/anything2explainer # Claude Code
ln -s "$PWD/anything2explainer" ~/.codex/skills/anything2explainer # Codex
依赖方面,需要 Node 18+(模板 npm install 会拉 Remotion 4.0.507 / React 19)、ffmpeg,以及一个 Python 虚拟环境装 edge-tts==7.2.8、numpy、pillow、scipy。英文旁白需要额外装 kokoro、soundfile 和 espeak-ng。
不需要 GPU:Remotion 通过无头 Chromium 在 CPU 上渲染;中文默认音色 edge-tts 是调用微软端点的云服务,英文默认音色 kokoro-82m 是一个 82M 参数、可在 CPU 本地跑的模型。
装好之后,在 Claude Code 或 Codex 里直接说想要什么,技能会自动触发:
讲一下向量数据库,做成一条讲解视频
Make me an explainer video about vector databases.
几个需要注意的限制
• 旁白一旦配音就冻结:镜头代码硬编码了帧号,改词等于重新对整片计时。
• 只支持中英双语,且只有一种视觉风格(两种背景可选)。
• 不支持竖屏:模板和所有安全区规则都假设 1280×720 横屏。
• 并行构建很吃资源:多个智能体同时打包 Remotion,需要留出至少 5 GB 空闲空间;终端面板数量也有上限,超过约 12 个需要分批调度。
• 许可为 PolyForm Noncommercial 1.0.0:非商用免费,商用需事先获得作者授权。用它能做出来的视频归你所有。内置的四款字体(Noto Sans SC / Orbitron / Exo 2 / Audiowide)按 SIL OFL 1.1 单独授权。
小结
anything2explainer 最打动人的地方,是它把一个「看起来很玄」的任务拆成了一条可检查、可干预、可复现的工程流水线:先写规范再画画面,先给 30 秒试看再全力开工,每个数字都要有出处,每帧都能靠改文件修好。它没有假装「一句话生成大片」,而是老老实实告诉你——好的讲解视频,靠的是一套流程,加上几个恰到好处的检查点。
如果你平时就在用 Claude Code 或 Codex,把它挂成技能,下次想给别人解释一个概念时,也许就真的不用再对着白板比划了。
















暂无评论内容