Andrej Karpathy(OpenAI 创始成员、前特斯拉 AI 总监)在 2026 年 3 月开源了 autoresearch,一个把「改训练代码、跑实验、看结果、决定保留还是回滚」这一整条循环交给 AI 智能体(能自主理解任务并动手执行的 AI 程序)完成的训练实验框架。项目本质是一个最小化的大模型训练工具包:喂给智能体一套精简的单 GPU 训练环境,它就会自己改代码、固定跑 5 分钟实验、按指标判断好坏并不断迭代。人类不再写训练代码,只需维护一份 Markdown 指令文件。适合手头有一张 NVIDIA 显卡、想低成本体验大模型训练研究的开发者、研究者和学生。仓库托管在 GitHub 的 karpathy/autoresearch,采用 MIT 许可,目前收获 9.51 万 star、1.34 万 fork。
它到底解决了什么问题
日常做大模型(LLM,一种在海量文本上训练、能生成和理解语言的 AI 模型)训练实验,研究人员要不断手动改代码、调参数、跑训练、看结果,循环往复,非常耗时。autoresearch 把这个循环自动化:智能体自主修改训练代码,训练固定时长后自动判断有没有变好,变好就保留、变差就回滚,然后换个思路再来。作者的原话是:给 AI 智能体一套小而真实的大模型训练环境,让它自主实验一整夜。你睡一觉醒来,就有一份实验日志,运气好的话还有一个更好的模型。
三根支柱的设计
整个仓库刻意保持很小,只有三个关键文件:prepare.py(固定,负责下载数据、训练分词器、提供运行工具,智能体不碰)、train.py(智能体唯一能改的文件,包含完整的 GPT 模型、Muon + AdamW 优化器(调整模型参数让预测误差下降的算法)和训练循环)、program.md(人类写给智能体的研究指令)。这个设计有三大支柱:
- 单文件修改:智能体只动 train.py,改动范围可控,事后审阅也方便。
- 固定 5 分钟时间预算:每次实验固定跑 5 分钟(不含启动和编译),约每小时 12 次实验、睡一觉约 100 次。固定时长让不同改动之间可以直接比较——不管改的是模型规模、批次大小还是结构,比拼的都是「同样 5 分钟内谁更好」。
- 单一可比较指标:用 val_bpb(验证集上「每字节比特数」,衡量模型预测精度的指标,越低越好,且不受词表大小影响)作为唯一评价标准,架构调整也能公平对比。
快速上手
环境要求:单张 NVIDIA GPU(作者用 H100 验证)、Python 3.10+、uv(Python 包管理器)。安装 uv 后依次执行 uv sync 装依赖、uv run prepare.py 下载数据并训练分词器(一次性、约 2 分钟)、uv run train.py 手动跑一次 5 分钟实验验证环境。环境就绪后,在仓库里启动一个 Claude Code / Codex 这类编程智能体(能读写代码的 AI 助手),让它读 program.md 开工即可。
没有 H100 也能玩
针对算力较小的设备,作者建议:换成 TinyStories 数据集(GPT-4 生成的短故事集,内容窄、更容易学好)、把词表大小从 8192 降到 4096 甚至更小、调低序列长度与模型层数(DEPTH)。社区也已移植出多个平台版本:autoresearch-macos(Mac)、autoresearch-mlx(Apple 芯片)、autoresearch-win-rtx(Windows)、autoresearch(AMD 显卡),低配用户可以直接用这些 fork。
值得注意的边界
固定时间预算的设计让实验「在同一台机器上可比」,但也意味着不同硬件上跑出的结果互不直接可比。另外该项目官方明示支持有限、更新不定期,更适合把它当作动手学习和实验的平台,而非生产依赖。如果你有一张闲置的 NVIDIA 显卡,想看看大模型训练研究是怎么一回事,autoresearch 是目前门槛最低的入口之一:一台单卡机器,一个晚上,100 次 AI 替你跑的训练实验。