AlphaGo方法论登陆足球:机器人自我对弈140年踢出梅西终结者

具身智能独角兽Skild AI推出人形机器人Messinator,在虚拟足球场通过自我对弈训练140年,仅以进球为奖励,自主学会盘带、护球、摔倒起身等复杂动作,验证了AlphaGo式self-play方法论在物理世界的可行性。
从围棋到足球:AlphaGo方法论在物理世界的复刻
2016年,AlphaGo通过与自己对弈发现人类棋手未曾预料的策略,以4:1击败李世石九段,拉开了AI变革的序幕。如今,这套方法论在物理世界找到了新的战场——足球。
美国具身智能公司Skild AI近期展示了一款名为Messinator的人形机器人。它身穿阿根廷队服,能够丝滑地带球过人并完成射门,名字由梅西(Messi)和终结者(Terminator)拼接而成,寓意"梅西终结者"。
但真正令人瞩目的不是演示视频本身,而是它背后的训练方式。
只给一个奖励:进球,其余全靠"悟"
Messinator的训练环境搭建在NVIDIA Isaac Sim之上,是一个虚拟足球场。团队只设定了一个目标——进球得分,没有为盘带、护球、抢断、射门或摔倒起身分别设计奖励函数。
机器人面对的对手,是它自己此前保存下来的旧版本模型。新旧版本反复比赛,胜出的新策略成为下一轮更难对付的对手,每一次进步都自动制造出下一道难题。
根据Skild AI技术博客的披露:
- 刚进入虚拟球场的前几个月,机器人连走路都不利索
- "长到大学生年纪",它自行学会了摔倒后重新站起来
- 随着对手不断变强,盘带绕防、身体护球、主动抢断等复杂行为陆续涌现
全程没有工程师规定它"必须这样做"——这些动作被保留下来,唯一的理由是它们能帮机器人赢球。
这套训练在仿真中累计运行了约140年的虚拟时间,最终将策略迁移到真实人形机器人上。Messinator不仅能走到球前完成射门,还学会了带球、护球、抢断,并在真人对抗中调整自己的位置和动作。
技术底座:一颗大脑控制所有机器人
Messinator的大脑来自Skild AI此前推出的旗舰模型S1,其核心能力是让机器人像大语言模型一样进行"上下文学习"——只需给它看一段任务示范视频,它就能将视频作为"提示词",理解意图并转换为适合自己身体的执行方式,遇到新任务无需重新训练即可上手。
但Skild AI认为,仅从人类数据学习的能力上限受限于人类经验。2025年7月,公司进一步推出了Skild Brain,主张"Any robot, any task, one brain",目标是打破"一种身体配一套大脑"的行业桎梏。
团队在仿真世界中生成了约10万种身体结构各异的机器人,让同一模型累计训练约1000个仿真年。测试阶段,模型需直接接管训练时从未见过的机器人——即使断腿、关节锁死或额外负重,也能在线调整重心和运动方式,部分情况下仅需数秒即可重新找回平衡。
这套omni-bodied训练的逻辑是:见过的身体越多,越无法靠死记硬背过关,模型只能理解平衡、关节、重心和动力之间更通用的物理规律。
如今的Messinator正是延续了这条路线,并叠加了self-play:Skild Brain负责控制身体、保持平衡和应对碰撞的基本功,self-play则负责思考"下一步该怎么做才会更好"。
团队背景:两位CMU教授的技术押注
Skild AI成立于2023年,脱胎于卡内基梅隆大学(CMU)机器人研究体系。联合创始人兼CEO Deepak Pathak本科毕业于印度理工学院坎普尔校区,后赴加州大学伯克利分校攻读计算机博士,师从Alyosha Efros和Trevor Darrell。他最具代表性的研究是"好奇心驱动的探索"——让机器人对陌生和难以预测的现象产生内在动力,主动探索环境并学会新能力。这一思路后来延伸到自监督学习、视觉模仿学习、Sim2Real和自适应控制等方向。
另一位联合创始人兼总裁Abhinav Gupta博士毕业于马里兰大学,现任CMU机器人研究所教授,长期专注于大规模视觉学习、自监督学习和终身学习,是早期"让机器人通过自主交互收集训练数据"路线的重要研究者。
对行业的启示
Messinator的意义不在于它踢得有多好,而在于它验证了一个关键命题:机器人不一定都要由人类亲手教会新动作,也可以自己练、自己输、自己总结、再自己变强。
self-play在围棋中已经证明可行,如今在足球这个连续、高动态、多自由度的物理环境中再次走通,说明这套方法论具有跨领域的通用性。对于具身智能行业而言,这意味着一条从"人类示范驱动"转向"自主探索驱动"的技术路径正在打开。
当机器人能在虚拟世界中自我对弈140年、在物理世界中自主进化出人类未教过的动作时,距离真正的通用机器人,或许比想象中更近。





