机器人领域的 AI 训练,正在从「让模型看懂世界」跨向「让模型看懂世界之后还会动手」。OpenWAM 就是为这件事打造的开源项目:它是一个开源的世界动作模型(World-Action Model,WAM)训练研究栈,把训练这类模型的各个环节拆成可自由组合的模块,并训练出了一个用 518.5M 帧第一视角视频打造的开源模型 OpenWAM-α。代码于 2026 年 9 月 6 日发布在 GitHub,论文 9 月 9 日上线 arXiv(编号 2609.07398),采用 Apache-2.0 许可。
大白话说,这个项目解决的是「机器人怎么学会动手」的问题:传统思路要么只训练模型看视频理解世界,要么直接让模型从图像输出动作,而世界动作模型把两者合在一起学——模型既要知道「世界接下来会怎么变」,又要知道「我该做什么动作」。所谓预训练,就是先用海量数据把模型的基础能力练好,之后想换任务时只需在它之上做小规模微调,不必从零开始——OpenWAM 走的正是这条路线。它的价值在于,把这套训练流程从各家「紧耦合、难复现」的黑盒,变成了模块化、可以做对照实验的开源平台。
这个项目适合谁用?主要是高校和企业的机器人、具身智能、AI 研究者:想复现世界动作模型训练的,想用自己数据微调 OpenWAM-α 的,想做不同模型结构、视频骨干对比实验的,都可以直接上手。目前仓库 405 star、16 fork,21 位贡献者提交了 798 次代码。
世界动作模型是什么
「世界动作模型」由两个概念拼成:
- 世界模型(World Model):从大量视频里学习「世界如何运转」的模型——物体怎么移动、遮挡后会发生什么。它让 AI 对接下来发生的事有预判能力。
- 动作模型(Action Model):根据当前看到的画面(比如摄像头输入),直接输出机器人下一步该执行的动作。
世界动作模型把两者合在一起端到端训练:模型既理解环境的动态规律,又直接产出动作。它与常见的视觉-语言-动作模型(VLA,Vision-Language-Action,即把图片和文字指令输入、直接输出动作的模型)的区别在于:VLA 偏重「听懂指令去做」,WAM 额外强调对世界动态的建模,更适合需要长时间推理和规划的任务。
三大组件:Infra、Study 与 α
OpenWAM 仓库由三块组成,分工明确:
- OpenWAM-Infra:模块化的基础设施,把模型结构、数据表示、训练、推理、部署、评测等设计选择拆成独立组件,支持自由组合和受控实验。
- OpenWAM-Study:受控研究的结论沉淀——例如如何继承现成世界知识、如何把世界学习与动作学习耦合、如何跨领域扩展规模。
- OpenWAM-α:应用这些原则、真正训练出来的开源世界动作模型。
OpenWAM-α:518.5M 帧第一视角数据训练
OpenWAM-α 是这套研究栈产出的核心模型,训练数据量为 518.5M 帧(约 6,400 小时)的第一视角(egocentric)人类与机器人数据。第一视角数据的意思是:画面来自「戴在人或机器人眼睛位置」的摄像头,与机器人实际执行任务时看到的视角一致——这与俯拍、第三人称拍摄的机器人数据相比,更贴近真实部署场景,是 OpenWAM-α 的一个关键差异点。
官方还公布了可复现的 RoboDojo 分数验证流程,把评测严谨性做进了项目流程里。
支持主流骨干与基准
OpenWAM 不与特定模型绑定,而是接入了主流生态:
- 视频骨干(video backbone,负责从视频帧里提取特征向量的模型):支持 Wan2.2-TI2V-5B、Wan2.1-VACE-1.3B、Wan2.1-I2V-14B-480P、Cosmos-Predict2.5-2B、Cosmos3-Edge 等。
- 评测基准(benchmark,用来衡量模型能力高低的标准化测试集):支持 RoboTwin2.0、RoboDojo、RoboDojo-Real、LIBERO、VLABench、EBench、RoboCasa365、RoboCasa_GR1 共 8 套。
- 预训练与微调权重全部托管在 HuggingFace 的 OpenWAM 组织下,下载即用。
怎么上手
官方 README 提供了从安装到部署的完整流程:用 conda 建 Python 3.10 环境,安装 PyTorch 2.7.1(CUDA 12.8),然后 pip install -e . 安装仓库;再用自带下载脚本拉取视频骨干权重、基准数据和 released checkpoint(训练好的模型权重文件);最后用 scripts/train.sh 训练或微调、scripts/deploy.sh 部署。
硬件门槛需要提前知道:官方建议训练使用 8 块 80GB 显存的 GPU。个人开发者可以先跑 debug 模式(20 步小规模)验证流程,再决定是否投入完整训练。
结论
OpenWAM 是目前少见的「把世界动作模型训练做成开源、模块化、可复现」的研究栈,核心资产是一个用 518.5M 帧第一视角数据训练的 OpenWAM-α 模型。如果你是机器人学习或具身智能方向的研究者,想省掉从零搭训练框架的功夫,直接用它做实验和微调,是当下值得尝试的选择。