孤本网
/ 0 阅读
0
0

星动纪元VPP2模型登顶RoboDojo仿真榜单,实现具身智能行动泛化突破

一句话结论

星动纪元VPP2模型在RoboDojo仿真榜单登顶全球第一,通过技术解耦实现真实机器人零样本操作突破。

关键要点

  • 星动纪元自研世界动作模型VPP2在RoboDojo仿真榜单登顶全球第一,综合平均成功率32.26%,综合平均得分39.26分。
  • VPP2未使用额外数据或Agent RSI等增强手段,仅靠标准数据集训练,技术路线将视频预测与动作学习解耦。
  • 在真实ALOHA双臂机器人零样本测试中,VPP2平均成功率58.5%,高于π0.5的40%,在10类任务中拿下9类最佳成绩。
  • VPP2基于阿里开源Wan2.1-I2V-14B模型,在机器人操作视频指令遵循测试中成功率达90%,高于64B参数的Cosmos3模型(78%)。
  • VPP2引入0.9B参数扩散Transformer(Action DiT),视频预测耗时约0.12秒,动作专家耗时约0.1秒,整体动作片段生成延迟约0.22秒。

背景与事实

2026年10月,星动纪元发布的自研世界动作模型VPP2在RoboDojo仿真榜单登顶全球第一。RoboDojo由香港大学MMLab牵头,全球近20所顶尖学术机构共建,包含42项双臂操作任务,覆盖泛化、精准操作、长程任务、记忆、开放词汇指令理解五个维度。在该榜单评测中,VPP2在泛化、精准操作、记忆三个维度得分第一,综合平均成功率32.26%,综合平均得分39.26分。

对比国际领先模型,VPP2展现出显著优势。在RoboDojo后训练评测中,VPP2对比GPT-6-Astra(成功率22.48%,得分28.97分),分别领先9.78个百分点和10.29分。在真实ALOHA双臂机器人零样本测试中,VPP2平均成功率58.5%,高于π0.5的40%,在10类任务中拿下9类最佳成绩。泛化测试中,VPP2在LIBERO-Pro任务成功率45.0%(基线最高11.0%),LIBERO-OOD组合泛化任务成功率63.9%。

技术层面,VPP2采用独特三阶段训练:事件级视频预训练、固定时长视频后训练与蒸馏、动作专家训练,将视频预测与动作学习解耦。模型基于阿里开源Wan2.1-I2V-14B开发,在机器人操作视频指令遵循测试中成功率达90%,高于64B参数的Cosmos3模型(78%)。VPP2引入0.9B参数扩散Transformer(Action DiT),采用MoT架构,通过冻结视频模型基础参数并使用LoRA适配,保持泛化能力。视频预测耗时约0.12秒,动作专家耗时约0.1秒,整体动作片段生成延迟约0.22秒。

商业应用方面,星动纪元与中国邮政、顺丰等企业开展合作,在全国5个省市、10余个物流中心常态化运营。VPP2模型已开源,提供了复现论文结果的可能性。作为清华唯一持股的具身智能公司,星动纪元此次突破使其VPP2在RoboDojo仿真榜单及真实环境零样本测试中表现优于GPT-6-Astra、Physical Intelligence π0.5及英伟达GR00T-N1.7等模型。

影响分析

对中国开发者与从业者而言,VPP2的开源与技术创新提供了重要参考。其技术路线表明视频预测与动作学习的分阶段训练能够提升机器人在陌生任务中的操作能力,这一方法论可直接应用于具身智能产品开发。VPP2在零样本测试中的优异表现证明,通过标准数据集训练即可获得跨场景泛化能力,降低了具身智能应用的数据门槛。

产业层面,星动纪元与中国邮政、顺丰的合作展示了具身智能在物流领域的实际价值。世界动作模型的竞争正从预测未来走向将预测转化为通用行动,具身智能的发展关键在于机器人能否将学到的本事带入更多陌生场景,实现物理世界的行动泛化。这一趋势将推动中国具身智能产业从实验室走向规模化应用。

适用边界

该结论适用于具身智能机器人操作场景,特别是双臂操作任务。VPP2的优势在标准化数据集训练条件下成立,若使用非标准数据或需要特殊增强手段的场景,其性能可能无法保持。实际应用受限于机器人硬件条件,ALOHA双臂机器人的测试结果不能直接推广至所有机器人形态。此外,当前评测主要基于仿真环境和特定真实场景,在开放复杂环境中的表现仍需验证。

孤本观察

VPP2的成功表明,解耦式训练策略在具身智能领域具有显著优势,这是基于其技术路线与实验结果的判断。模型轻量化设计(0.9B参数Action DiT)与高效延迟(0.22秒)的组合,暗示具身智能正走向实用化部署阶段。

常见问题

星动纪元VPP2在RoboDojo榜单的综合成功率是多少?

VPP2在RoboDojo仿真榜单的综合平均成功率为32.26%,综合平均得分为39.26分,登顶全球第一。

VPP2在真实ALOHA机器人零样本测试中的成功率如何?

在真实ALOHA双臂机器人零样本测试中,VPP2平均成功率达58.5%,高于π0.5的40%,并在10类任务中拿下9类最佳成绩。

VPP2生成动作片段的整体延迟是多少?

VPP2视频预测耗时约0.12秒,动作专家耗时约0.1秒,整体动作片段生成延迟约为0.22秒。

VPP2模型基于哪个开源模型开发?

VPP2基于阿里开源的Wan2.1-I2V-14B模型开发,在机器人操作视频指令遵循测试中成功率达90%。

VPP2的训练是否使用了额外数据或增强手段?

没有。VPP2未使用额外数据或Agent RSI等增强手段,仅靠标准数据集训练,采用视频预测与动作学习解耦的技术路线。

来源:量子位


评论