孤本网
/ 0 阅读
0
0

Skild AI推出Messinator:自我对弈140年虚拟世界杯后,人形机器人掌握复杂足球技能

一句话结论

Skild AI的Messinator机器人通过140年虚拟自我对弈,自主进化出带球射门能力,验证了无人类干预的强化学习路径。

关键要点

  • Skild AI开发的人形机器人Messinator在NVIDIA Isaac Sim虚拟足球场中完成自我对弈训练,等效时长达140年,无需人工设定具体动作奖励即可掌握盘带、护球和射门技能。
  • 该机器人基于Skild AI旗舰基础模型S1构建,采用self-play方法论,训练过程中对手仅为自身旧版本模型,新策略通过赢得对局自动成为下一轮训练的挑战目标。
  • Skild AI于2025年7月发布跨硬件机器人基础模型Skild Brain,主张“Any robot, any task, one brain”,此前已生成约10万种机器人身体结构并完成累计约1000个仿真年的omni-bodied训练。
  • 机器人前几个月无法利索走路,但在“长到大学生年纪”阶段自行学会摔倒后重新站立,后续随着对手变强逐步发展出带球绕过防守、身体护球和主动抢断等复杂行为。
  • 公司由卡内基梅隆大学教授Deepak Pathak和Abhinav Gupta联合创立,Pathak以好奇心驱动探索研究著称,Gupta曾参与建立Facebook AI Research匹兹堡实验室并获得斯隆研究奖。

背景与事实

2026年,美国具身智能初创公司Skild AI发布了名为Messinator的人形机器人演示视频,该机器人穿着阿根廷队服在真实环境中完成带球过人并射门。这一成果源于团队在NVIDIA Isaac Sim构建的虚拟足球场中进行的self-play强化学习实验。Skild AI技术博客披露,训练设置仅设定最终目标为进球获得高分,未对盘带、护球、抢断或倒地起身等中间行为单独设置奖励函数。机器人面对的始终是自身此前保存的模型版本,通过新旧版本反复比赛,获胜策略成为下一轮更难对付的对手,形成自动化的难度递进机制。

训练过程呈现出明显的阶段性特征。Skild AI指出,机器人刚进入虚拟球场的前几个月连走路都不利索;但等它“长到大学生的年纪”,便自行学会了摔倒后重新站起来。随着对手不断变强,机器人盘带绕过防守、用身体护球、主动抢断等更复杂的行为开始陆续出现。全程没有工程师规定具体动作,机器人保留这些行为的唯一原因是它们能帮自己赢球。这一方法论与AlphaGo通过自我对弈发现超出顶尖棋手预期的下法具有相似性,但将应用从离散棋局扩展到了连续物理世界。

Messinator的核心能力来自Skild AI此前推出的旗舰机器人基础模型S1。S1最核心的能力是让机器人像大模型一样进行“上下文学习”,即通过观看一段任务示范视频将视频作为“提示词”,逐步理解任务意图并转换为适合自身身体的执行方式,遇到新任务无需重新训练即可上手。Skild AI认为,主要依赖人类数据学习的基础模型能力上限受人类经验限制,因此通过在S1基础上叠加强化学习和self-play,让机器人自己创造经验并发现人类未教过的动作。

Skild AI成立于2023年,脱胎于卡内基梅隆大学机器人研究体系。团队成员包括来自卡内基梅隆大学、斯坦福大学、加州大学伯克利分校等高校的研究人才,以及曾任职于Meta、Tesla、NVIDIA、Google、Amazon和Everyday Robotics等机构的研究员及工程师。2025年7月,公司正式推出能够跨硬件运行的机器人基础模型Skild Brain,核心主张为“Any robot, any task, one brain”,旨在打破“一种身体配一套大脑”的行业限制。随后两个月内,团队公开了一组omni-bodied训练成果,在仿真世界中生成约10万种身体结构各异的机器人,让同一个模型累计训练约1000个仿真年。测试阶段,模型需直接接管训练时从未见过的机器人,即便机器人出现断腿、关节锁死、轮子卡住或背上额外负重等故障,模型也不会立刻失效,而是根据身体状态在线调整重心和运动方式,部分情况下仅需几秒钟就能重新找回平衡。

公司联合创始人兼CEO Deepak Pathak本科毕业于印度理工学院坎普尔校区计算机专业,后赴加州大学伯克利分校攻读计算机博士,师从计算机视觉领域知名学者Alyosha Efros和Trevor Darrell。博士毕业后,他曾在Meta AI Research从事研究工作,也曾在伯克利与机器人学习专家Pieter Abbeel合作担任访问博士后,此后进入卡内基梅隆大学成为机器人研究所和机器学习系教授。Pathak最具代表性的研究是“好奇心驱动的探索”,核心思路是赋予机器人对陌生现象的内在动力,使其主动探索环境并学会新能力,该研究后来延伸到自监督机器人学习、视觉模仿学习、Sim2Real和自适应控制等方向。联合创始人兼总裁Abhinav Gupta博士毕业于马里兰大学计算机系,现任卡内基梅隆大学机器人研究所教授,曾参与建立Facebook AI Research匹兹堡实验室并担任研究管理和领导职务,长期专注于大规模视觉学习、自监督学习、终身学习、机器人操作和物理常识研究,是早期“让机器人通过自主交互收集训练数据”路线的重要研究者,曾获得斯隆研究奖、PAMI青年研究员奖、IAPR J.K. Aggarwal Prize等奖项。

影响分析

对于中文开发者与从业者而言,Skild AI的此次演示提供了一条不同于当前主流“人类数据驱动”路线的可行技术路径。当前国内多数具身智能公司依赖大量人类演示数据进行模仿学习,而Skild AI证明机器人可以通过与自身旧版本对弈自主发现人类未教过的动作,这可能降低对高质量人类示范数据的依赖程度,尤其适用于缺乏特定领域人类演示数据的新场景。然而,必须明确这是分析判断:140年虚拟训练所需的计算资源和仿真环境搭建成本尚未公开,中文团队在复现时需要考虑NVIDIA Isaac Sim的授权成本以及等效140年训练的实际墙钟时间。

从技术迁移角度看,Skild AI的“一颗大脑控制所有机器人”理念若能在真实场景验证,将显著降低多形态机器人部署的工程复杂度。中文从业者可借鉴其omni-bodied训练思路,在仿真阶段生成多样化机器人身体结构以提升模型泛化能力,但需注意仿真与真实物理环境之间的gap(Sim2Real问题)仍是行业公认难点。当前演示仅证明机器人能在真实球场完成带球射门,但尚未展示在高速对抗、多球协作等更复杂场景下的表现,中文团队在评估技术成熟度时应保持审慎。

适用边界

该结论在以下条件下不成立或不适用:首先,140年虚拟世界杯训练是基于NVIDIA Isaac Sim仿真环境的结果,直接将其等同于真实足球比赛表现存在仿真到现实(Sim2Real)的差距,真实球场的草皮摩擦、风力影响、球门网弹性等物理因素未被完整建模,Messinator在真实高强度对抗中的稳定性未经验证。其次,self-play方法论在足球场景的成功不代表可无缝迁移到其他领域,足球具有明确的胜负规则和相对简单的物理交互,而机器人搬运、柔性物体操作等任务的奖励函数设计更为复杂,单纯依赖进球作为唯一奖励的方式可能不适用于需要精细力控的任务。此外,Skild AI声称的“无需人工设定具体动作奖励”仅针对训练过程中的中间行为,真实部署时仍需工程师处理安全约束、能耗优化等非奖励函数涵盖的问题。最后,该技术路线对计算资源要求较高,中小规模团队若缺乏大规模GPU集群支持,难以在合理时间内复现等效140年的训练量。

孤本观察

编辑观察认为,Skild AI选择足球作为self-play验证场景具有巧思:足球拥有成熟的虚拟赛事规则、清晰的胜负判据和相对标准化的物理环境,比无序物理场景更易生成可量化的训练信号,但这也意味着该方法在缺乏明确赢输判据的开放域任务中有效性存疑。来源中“140年”为虚拟训练等效时长而非真实时间,若以当前硬件算力折算实际墙钟时间,对创业公司的计算资源门槛提出了更高要求。

常见问题

Skild AI的Messinator机器人等效训练时长是多少?

Messinator在NVIDIA Isaac Sim虚拟足球场中完成的自我对弈训练等效时长达140年。

Messinator基于哪个基础模型构建?该模型的核心能力是什么?

基于旗舰基础模型S1构建,其核心能力是通过观看任务示范视频进行上下文学习,无需重新训练即可上手新任务。

Skild AI在omni-bodied训练中生成和累计训练了多少仿真年?

Skild AI生成约10万种机器人身体结构,并完成累计约1000个仿真年的omni-bodied训练。

训练过程中未设定具体动作奖励的原因是什么?

未设定具体动作奖励是因为机器人保留行为的唯一原因是它们能帮助自己赢得对局,从而自主进化出复杂技能。

Skild AI联合创始人Deepak Pathak最具代表性的研究方向是什么?

Pathak最具代表性的研究是“好奇心驱动的探索”,旨在赋予机器人对陌生现象的内在动力以主动探索环境。

来源:量子位


评论