2026 年 9 月,GitHub 上出现了一个叫 Anything2Explainer 的开源项目,作者是 Vincentwei1021(Yihao)。它是一个给 AI 编程代理用的「技能包」:你给它一句主题需求,它就能产出一条带配音、字幕和章节进度条的动画解说视频。截至抓取快照(2026 年 9 月 10 日),仓库已有 612 个 star、109 个 fork(star 相当于点赞收藏,fork 是复制一份到自己账号下)。
这个项目是什么
Anything2Explainer 不是一个你直接运行的软件,而是一套 Agent Skill。Agent Skill 可以理解为给 AI 编程代理安装的「操作手册」:Claude Code、Codex 这类 AI 助手(能自己读代码、执行命令、按指令完成开发任务的 AI 程序)装上它之后,接到「做一条讲解向量数据库的视频」这类需求,就会按手册写好的流程一步步执行,直到产出成品。
它适合三类人:已经在用 Claude Code 或 Codex 的开发者;想低成本批量做科普、教程视频的内容创作者;想研究「多个 AI 协作制片」这种新玩法的人。用它不需要会剪辑,也不需要出镜。
项目的核心做法是:不用生成式视频模型,画面全部由代码绘制。每个画面都是用 React 加 TypeScript 写的,视频由代码逐帧渲染出来,而不是剪辑软件拼出来,也不是 AI 凭空生成画面。
视频是怎么做出来的
整个制片过程分 9 个阶段:搭工程骨架、AI 调研员带着来源链接整理资料(要求每个数字都能溯源)、写解说词并生成配音时间轴、画分镜、设计封面和章节卡、出 30 秒样片、把镜头分给多个「构建智能体」并行编写、渲染成片、按质检标准修复。全程大约 1 到 3 小时,其中大部分时间是多个 AI 并行画画面。
画面渲染用 Remotion——一个用 React 代码写视频的框架,输出规格固定为 1280×720、30 帧每秒、H.264 编码(通用视频压缩格式)。配音方面,中文默认走微软 edge-tts 云语音,英文默认用 kokoro-82m 本地模型;也可以换成自己的配音文件。字幕与配音逐字对齐,屏幕底部有章节进度条。
仓库自带的参考成片是《RAG 与知识库》主题:英文版 5 分 02 秒、44 个镜头,中文版 4 分 54 秒、同一套 44 镜头分镜。RAG 和向量数据库可以粗浅理解为:按「含义相似」而非「字面相同」来检索数据的存储方式,常用于 AI 应用的知识库。
四个需要你确认的节点
流程不会闷头跑完,只在四个节点停下来等你确认:成片长度与语言、解说词定稿、配音引擎选择、前 30 秒样片效果。解说词一旦配音,每个镜头的帧号就写死了,改一个字就要重排整条时间轴,所以定稿节点最值得盯紧。样片阶段改风格只影响一个镜头组,全部渲染完再改就要全部重来。
和生成式视频模型的区别
Sora、Veo、Runway 这类生成式视频模型,是让 AI 根据提示词合成画面像素。Anything2Explainer 走的是另一条路:每个数字都可以溯源,每一帧都可以精确修改——屏幕上出现的每个数字都要能对应到调研文档里的来源链接,想改某一帧,改对应的一个镜头文件重新渲染即可。代价是视觉风格统一(黑底、白色线条画、紫色点缀),且刻意不做真人出镜。
硬件与时间成本
不需要 GPU:画面由无界面浏览器(headless Chromium,即没有窗口的浏览器)在 CPU 上渲染,英文配音的 kokoro-82m 模型也是本地 CPU 运行。产出速度与片长直接相关:2 到 3 分钟成片大约 1 小时(24 到 32 个镜头),3 到 5 分钟大约 2 小时(40 到 50 个镜头),5 到 8 分钟大约 2 到 3 小时(60 到 80 个镜头)。并行构建时多个 agent 同时打包,需要预留至少 5GB 磁盘空间。
许可与限制
项目采用 PolyForm Noncommercial 1.0.0 许可:个人非商用免费,商用需要先获得作者授权;用这个工具做出来的视频归你所有。当前限制还有:只支持中文和英文、只输出 1280×720 横屏(不支持手机竖屏 9:16)、不适合复刻现有视频或真人出镜类内容。
结论
做一条讲解视频这件事,在 Anything2Explainer 里变成了给 AI 编程代理下达一句指令。它比生成式视频模型更可控——画面可溯源、可精确修改;比手动用 Remotion 更省事——调研、解说、分镜、质检的完整方法链都是现成的。如果你已经在用 Claude Code 或 Codex,想低成本产出中英双语讲解视频,这个项目值得直接 clone 下来试;如果你需要商用授权或竖屏视频,它目前还不合适。