anything2explainer:给 AI 编程助手装上「讲解视频」技能,输入主题就出一条带配音字幕的讲解片

anything2explainer:给 AI 编程助手装上「讲解视频」技能,输入主题就出一条带配音字幕的讲解片

在 GitHub 上,把「文字变视频」这件事做出来的项目很多,但大多要么调用生成式视频模型赌像素,要么只是一个 CLI 工具。anything2explainer 走的是另一条路:它不是一个工具,而是一整套「方法」——一套让 AI 编程助手(Claude Code / Codex)能够独立完成一部讲解视频的技能包。

你只需要给它一个主题,比如「讲一下向量数据库」,它就会自己调研、写旁白、配音、画分镜、并行写代码渲染,最后交付一条 1280×720 的 MP4:带 TTS 配音、逐词对齐字幕、章节卡片和底部章节进度条,全程每一帧都是用代码画出来的,没有任何一帧来自别处。

这个项目 2026 年 9 月 8 日建仓,几天内就冲到 900+ star,是目前「AI Agent 做视频」方向里少见的、把完整方法论都开源出来的作品。

• 项目地址:github.com/Vincentwei1021/anything2explainer

它到底是什么:不是工具,是一整套做片子的方法

作者在 README 里反复强调一句话:It is not a CLI.(这不是一个命令行工具)。

它真正交付的东西是:一个可直接编译的 Remotion 模板、一套图元与光照库、配音/分镜/渲染/量化质检的工具脚本、写好的风格与运动规范、一套多智能体分工协议,以及一部完整的参考影片作为质量标尺。

输入是「一个主题(或一篇文章 / 文档)+ 时长 + 语言」,输出是「一条 1280×720 的 H.264 MP4 + 全套过程文档」——调研稿(含来源链接)、旁白稿、分镜表、每个镜头的源码、质检报告。整条流水线大约 1 到 3 小时,其中大部分时间都是多个智能体在并行地画镜头。

九个阶段,四个检查点

整个流程写在 SKILL.md 里,共九个阶段:搭脚手架 → 调研 → 旁白与时间轴 → 分镜 → 叠加层与图元 → 先导片(60 秒试看)→ 并行构建 → 渲染 → 质检与修复。

其中最值得说的一点,是它只在四个检查点停下来等你拍板,而不是一路闷头做完:

1. 时长与语言:在写脚本前确定。时长决定行数、镜头数和并行智能体的数量——也就是这部片子到底能讲多深;语言会切换 src/config.ts 里的 lang 字段,连带排版、字幕预算和默认音色一起变。

2. 旁白定稿:在配音之前。一旦锁定,帧号就被硬编码进每个镜头,改一个字就要重新对整条片子计时。这是最便宜的干预点。

3. 配音:问你要不要指定 TTS 引擎。不指定就用默认(中文 edge-tts 云希,英文 kokoro-82m Liam)。你也可以自己交一段成片音频,手动填每行的时间轴。

4. 先 30 秒:只做完第一个镜头组,先渲染 30 秒给你看效果。在这里改风格只花一个组的成本,等全片渲染完再改,就是每个组都要返工。

输出规格与时长档位

项目 规格
画面 / 帧率 1280×720 @ 30fps,H.264
时长 2–8 分钟均可
语言 中文或英文(lang 字段),排版、字幕预算、默认音色随之切换
视觉 黑底画布 + 星空雾渐变 或 点阵波(bg 字段);白色线稿 + 紫色点缀,超粗标题字
常驻图层 44px 白字黑描边字幕、底部章节进度条、顶部胶囊 HUD
配音 中文 edge-tts 云希 / 英文 kokoro-82m Liam,或自带 TTS

时长直接决定整条流水线的规模:

时长 中文字数 英文词数 镜头数 构建智能体 墙钟时间
2–3 分钟 700–950 280–420 24–32 4–6 约 1 小时
3–5 分钟(参考档) 1200–1500 420–700 40–50 8 约 2 小时
5–8 分钟 1800–2400 700–1150 60–80 10–14 约 2–3 小时

每一帧都是代码画出来的,每一个数字都有出处

这个项目最有意思的地方在于它把「可复现」和「可溯源」当成了硬性要求。

每一帧都画在代码里。 没有一帧来自现有视频,没有生成式视频模型,也没有从任何人作品里截的帧。所有动画都是帧号的纯函数,随机数带种子,文本适配是算出来的而不是在 DOM 里量的——所以重新渲染会得到完全一致的帧。想改某一帧?改那一个镜头文件就行。

每一个事实都能溯源。 屏幕上出现的每个数字、年份、机构和英文术语,都必须能在该片的调研文档里找到对应的来源 URL。任何没核实过的东西,既不上屏也不进旁白。项目还单独声明了原创性:可选的实拍 B-roll 必须来自免版权来源,并在 MANIFEST 里登记 sha256、来源 URL、许可和用途。

先讲风格,再讲画面

在动手画之前,这个技能会先写好两套规范,所有镜头都只能使用其中的「词汇」:

风格规范 reference/style-guide.md:安全区、调色板、字体、图元目录、排版习惯;

运动词汇表 reference/motion-vocabulary.md:入场/强调/光照/退场/镜头运动的公式和帧数。

整个项目只有一种视觉风格,并且刻意只留一个开关:背景是 bg: 'stars' 还是 bg: 'dots'。想改别的,就得去动 reference/style-guide.mdsrc/ui.tsx——因为镜头代码只调用这些基础图元。

这种设计的好处是,几千帧的画面能保持高度统一,而不会越做越花。

不是演示,是真有参考影片

仓库里带着一部完整的参考影片:《RAG 与知识库》,中文版 4 分 54 秒,44 行 / 1490 字,点阵波背景;英文版 *RAG & Knowledge Bases* 5 分 02 秒,44 行 / 785 词。两版共用同一个分镜和 44 个镜头,英文版为英文旁白重新对时。

更有价值的是 examples/rag/ 目录里保留了整条「纸面痕迹」:从调研稿、旁白、分镜,到每个镜头的源码、质检报告和交付说明。原始中文版是 4 分 35 秒、星空背景,由 8 个构建智能体并行跑了 40 分钟,经历两轮质检产出。

examples/contrast/ 里还放了 6 组「坏/好」对比帧,作为构图与光照的标尺——这比任何文字规范都直观。

和其他方案的区别

工具类型 它产出什么 anything2explainer 的不同
生成式视频模型(Sora、Veo、Runway) 由提示词合成的画面 确定性代码,不是像素。屏幕上的每个数字都能追溯到来源 URL,任何一帧都能靠改一个镜头文件修好
数字人 / 口播工具(HeyGen、Synthesia) 一个念稿的虚拟主播 没有主播。用动态图形图解机制,旁白驱动画面
手写 Remotion 或 Motion Canvas 一块可编程的视频画布 在画布之上交付了整套方法:调研 → 旁白 → 分镜 → 并行构建 → 质检,附带风格规范、运动词汇和参考影片
Manim Python 数学动画 智能体驱动的端到端流水线,带 TTS 对齐字幕、章节和质检;用 React / TypeScript 而非 Python

安装与使用

安装就是克隆加软链接,让它成为 Claude Code / Codex 的技能:

git clone https://github.com/Vincentwei1021/anything2explainer.git
ln -s "$PWD/anything2explainer" ~/.claude/skills/anything2explainer   # Claude Code
ln -s "$PWD/anything2explainer" ~/.codex/skills/anything2explainer    # Codex

依赖方面,需要 Node 18+(模板 npm install 会拉 Remotion 4.0.507 / React 19)、ffmpeg,以及一个 Python 虚拟环境装 edge-tts==7.2.8numpypillowscipy。英文旁白需要额外装 kokorosoundfileespeak-ng

不需要 GPU:Remotion 通过无头 Chromium 在 CPU 上渲染;中文默认音色 edge-tts 是调用微软端点的云服务,英文默认音色 kokoro-82m 是一个 82M 参数、可在 CPU 本地跑的模型。

装好之后,在 Claude Code 或 Codex 里直接说想要什么,技能会自动触发:

讲一下向量数据库,做成一条讲解视频

Make me an explainer video about vector databases.

几个需要注意的限制

旁白一旦配音就冻结:镜头代码硬编码了帧号,改词等于重新对整片计时。

只支持中英双语,且只有一种视觉风格(两种背景可选)。

不支持竖屏:模板和所有安全区规则都假设 1280×720 横屏。

并行构建很吃资源:多个智能体同时打包 Remotion,需要留出至少 5 GB 空闲空间;终端面板数量也有上限,超过约 12 个需要分批调度。

许可为 PolyForm Noncommercial 1.0.0:非商用免费,商用需事先获得作者授权。用它能做出来的视频归你所有。内置的四款字体(Noto Sans SC / Orbitron / Exo 2 / Audiowide)按 SIL OFL 1.1 单独授权。

小结

anything2explainer 最打动人的地方,是它把一个「看起来很玄」的任务拆成了一条可检查、可干预、可复现的工程流水线:先写规范再画画面,先给 30 秒试看再全力开工,每个数字都要有出处,每帧都能靠改文件修好。它没有假装「一句话生成大片」,而是老老实实告诉你——好的讲解视频,靠的是一套流程,加上几个恰到好处的检查点。

如果你平时就在用 Claude CodeCodex,把它挂成技能,下次想给别人解释一个概念时,也许就真的不用再对着白板比划了。

• 项目地址:github.com/Vincentwei1021/anything2explainer

© 版权声明
THE END
喜欢就支持一下吧
点赞10 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容