焉知汽车科技

  • 首页
  • 文章
  • 视频
  • 资料

智元发布GE-Act 2.0,首次验证原生世界—动作模型预训练与Scaling路径

2026-09-09 17:16 39
摘要:
继AGILE 2.0 感控一体模型之后,智元今天继续发布GE-Act 2.0 原生世界—动作模型(World Action Model,WAM),首次系统验证了原生世界—动作模型的预训练与Scaling路径。 GE-Act 2.0 专为具身控制设计了高效视觉编码器,一帧画面压缩为24个视觉Token,仅为 DINOv3 的 1/16,同时保持较强的视觉理解能力,并与物理动作形成更强关联。模型还能够兼容真机遥操作、人类第一视角、无指令Rollout,甚至失败数据等多类型训练数据,进一步提升数据利用效率。 针对机器人“看起来理解了、实际执行却发生错位”的问题,GE-Act 2.0 通过KASO方法,增强视觉理解与实际动作之间的一致性。同时,模型经过真机零样本测试,不针对具体任务进行特训,也未提前接触测试场景和物体,而是以同一模型、同一组参数直接完成陌生环境下的任务

如果把训练数据从 300 小时扩大到 30,000 小时,机器人模型能否像大语言模型一样,随数据增长不断解锁新能力?

智元最新发布的原生世界—动作模型(World Action Model,WAM)GE-Act 2.0,首次系统回答了这个问题。与沿用现成视频生成模型的主流路线不同,GE-Act 2.0 的所有模型参数,包括视觉表征、未来生成、动作预测等核心组件均从随机初始化开始,在具身操作数据上从头训练。训练完成后,模型不针对评测任务做任何微调和示范,直接在陌生场景、陌生物体上,接受语言指令跟随、多技能操作和陌生环境泛化等真机零样本(Zero-shot)检验——覆盖 100 项原子任务、20 类技能、两种机器人本体。

结果显示,随着数据规模扩大 100 倍,模型不仅原有技能更稳定,还逐步解锁了此前完全无法完成的新任务,包括折叠毛巾、嵌套纸杯、拔插笔盖、插花等较精细动作,原生世界—动作模型的 Scaling 路径首次被系统性验证。




图中每个任务接受四档数据量训练(300 小时/ 1200 小时/ 5000 小时/ 30000 小时),随着训练数据不断扩大,技能覆盖范围与任务成功率同步扩大,这验证了原生世界-动作模型预训练与Scaling路径

项目主页及论文:https://ge-act-v2.github.io/


一、用 Zero-shot 检验预训练,用 100 倍数据验证 Scaling

针对评测任务做额外训练,能刷高成绩,却分不清能力来自通用预训练还是“考前特训”。GE-Act 2.0 因此把真机零样本表现作为标准:不微调、不示范、不换模型,测试中的场景、背景、光照和物体实例均未进入训练。在相同训练配方下,最后一阶段分别使用 300 / 1,200 / 5,000 / 30,000 小时四档数据,三条 Scaling 线索清晰可见:

•        技能“逐格点亮”:取得非零成功率的任务,在 G1-OP 机器人上从 39 项增至 76 项,在 G2-90D 机器人上从 24 项增至 72 项。折叠毛巾、嵌套纸杯、拔插笔盖、插花等较精细动作在小规模数据训练的模型上无法被理解,当数据达到3万小时规模时出现显著的能力顿悟;

•        任务成功率持续提升:G1-OP 机器人总体成功率从 17.1% 提升至 44.1%,G2-90D 机器人从 13.4% 提升至 31.1%,且 5,000 到 30,000 小时仍未见明显饱和;

•        “富本体”带动“稀缺本体”:G1-OP 机器人贡献超 50% 训练数据,G2-90D 机器人占比不足 2%,但后者仍随共享数据扩大提升 17.7 个百分点,显示出跨本体能力迁移真实发生。


随着训练数据规模扩大,两种机器人本体的多数技能持续提升,数据占比不足2%的G2-90D同样获得明显增长。


作为补充,微调后的 GE-Act 2.0 在 RoboTwin 陌生环境测试中取得 60.52% 成功率,在 GenieSim 指令遵循测试中获得 0.770 分,均超过 π0.5、GR00T N1.7 等参与比较的模型。



二、原生 World Action Model 如何预训练:GE-Act 2.0 给出了方法论

传统动作模型“看到什么就做什么”;世界—动作模型多走一步:先预测“这样做下去,世界会变成什么样”,再决定动作。然而大多数世界—动作模型从现有的视频生成模型出发,再接入动作模型,这种方法难以看清世界预测与动作能力究竟如何从具身数据中获得。GE-Act 2.0 设计了面向具身操作重新设计整套架构,给出了从头预训练的完整方法论。

GE-Act 2.0架构

原生高效表征:一帧画面压缩为 24 个 token

机器人既要看清物体和运动,又要控制计算成本。GE-Act 2.0 设计更高效的视觉编码器 CoAE,将一帧 256×384 画面压缩为 24 个视觉 token,仅为 DINOv3 的十六分之一,同时保留语义、运动与局部结构。压缩后反推动作的精度与 DINOv3、V-JEPA 2.1 等高信息量表征接近,在 4,000 条机器人操作数据的受控测试中,指令—画面匹配准确率达 97.95%,为五种对照表征中最佳。

原生视觉规划器:让“想象”与“行动”共同优化

世界模型负责预测未来,逆动力学模型(IDM)负责生成动作。传统方法需要多轮计算才能生成未来,计算与显存占用极高,既难以让两个模型共同训练,也会拖慢推理速度。GE-Act 2.0采用一步式视觉规划,一次生成完整未来,并让动作误差直接反馈给世界模型。配合高效视觉表征,模型在RTX 5090显卡上生成一个chunk连续动作仅需104毫秒,大幅优于现有大部分WAM。

联合训练方案:KASO 破解“预测和动作对不上”

同一任务常有多种正确做法:模型想象“左手抓取”,数据记录的却是“右手”,各自合理,合在一起就是错误信号。GE-Act 2.0 以知识对齐选择性优化方法(KASO):一次生成多个可能的未来,只选择与真实动作最一致的结果参与训练,来解决这个问题。在陌生场景的分布外(OOD)评测中,机器人选对指令目标的比例较基线提高7.5个百分点,最终完成抓取的成功率提高10个百分点。


KASO从多个预测未来中选出与真实动作最一致的结果,再用于联合训练,避免未来预测与动作监督错位


三、一套“吃进所有数据”的架构:遥操、无本体、Rollout、失败数据各就其位

机器人训练与部署中产生的数据形态各异,传统模仿学习依赖完整的“指令—画面—动作”配对,大量数据因此被浪费。GE-Act 2.0 提出的数据架构让每类数据承担合适的学习任务:

•        3.9 万小时“指令—视频”数据预训练世界模型,学习环境如何变化——其中包含 3,000 小时无本体数据(不带动作标注的第一视角与人类操作视频);

•        3.2 万小时机器人轨迹预训练逆动力学模型(IDM),学习“画面这样变化时机器人做了什么”——其中包含 2,000 小时失败操作与真实场景部署回流(rollout)数据,不要求成功标签;

•        3 万小时“指令—视频—动作”完整数据进行联合训练,把两种能力连接起来。

借助逆动力学模型,无指令、无成功标签、甚至失败的轨迹都能还原出动作监督信号——失败数据也能成为训练资产。


分阶段预训练

结语

GE-Act 2.0 验证了原生世界—动作模型可规模化的预训练路径,也是从“世界预测”走向“世界驱动行动”的关键一步。在智元 GE 世界模型体系中,GE-Sim 面向策略评估与环境构建,GE-Act 将未来预测转化为真实机器人的操作能力。当更多类型的具身数据被统一利用、零样本能力随数据规模持续增长,具身基础模型的 Scaling 路径,正在变得更加清晰。

评论 0

请先 登录 后再发表评论~

木木

0

获赞

0

粉丝

0

关注

热门文章

IROS 2025现场直击:AC2发布获顶尖学者团认可,机器人之眼迎来突破性进展
IROS 2025现场直击:AC2发布获顶尖学者团认可,机器人之眼迎来突破性进展
芯驰科技E3650正式量产,22纳米旗舰MCU率先领跑下一代汽车架构
芯驰科技E3650正式量产,22纳米旗舰MCU率先领跑下一代汽车架构
知见:焉知智电产业1月刊【汽车人都关心的汽车事】
知见:焉知智电产业1月刊【汽车人都关心的汽车事】
汽车行业数字化转型白皮书:绸缪御风之术,臻于至善,业数合力创新,步步为营
汽车行业数字化转型白皮书:绸缪御风之术,臻于至善,业数合力创新,步步为营
2024年汽车行业展望
2024年汽车行业展望
爱芯元智今日登陆港交所:中国边缘AI芯片第一股诞生,智能汽车赛道加速突围
爱芯元智今日登陆港交所:中国边缘AI芯片第一股诞生,智能汽车赛道加速突围
汽车行业数据发展研究报告(2023)
汽车行业数据发展研究报告(2023)
智能驾驶计算芯片性能评测标准化白皮书
智能驾驶计算芯片性能评测标准化白皮书
AutomotiveSPICE_V40_中文版.pdf
AutomotiveSPICE_V40_中文版.pdf
嬴彻科技《自动驾驶卡车量产白皮书》102页
嬴彻科技《自动驾驶卡车量产白皮书》102页

更多精华美文扫码阅读

焉知汽车

焉知汽车

焉知机器人

焉知机器人

© 2018-2025 焉知 All Right Reserved · 沪ICP备15043037号-5 沪公网安备 31011502007507号