一句话结论
具身智能研发正从单次动作演示全面转向动态环境下的持续感知、在线修正与完整任务闭环能力。
关键要点
- GOAI「具身未来 Embodied Future」赛道 20 支决赛团队在双臂操作与全地形巡逻中验证闭环控制与环境泛化能力
- TwinFlow-XR1 集成视觉语言模型与动作专家,在执行中持续重观察环境并更新后续动作序列
- Lion-VLA 覆盖 12 类双臂任务,每执行 8 步重新观察并规划,在连续性与纠偏间取得平衡
- “草地牛_Robot”将训练数据从约 1200 段扩展至 4800 段(约 237 万帧),通过改变材质光照提升环境适应能力
- 9 月 22 日至 23 日世界人工智能开源大赛(GOAI)总决赛将在杭州举行,具身未来赛道进入真实任务检验阶段
背景与事实
2025 年,随着机器人技术进入真实物理环境验证阶段,具身智能领域的研发重点发生结构性转变。GOAI 世界人工智能开源大赛的「具身未来 Embodied Future」赛道展示了 20 支入围团队的最新技术成果,这些团队被分为双臂协作操作和全地形巡逻两类任务组。该赛道的设计初衷并非追求单次动作的完成度,而是检验机器人在动态、不完全可控的物理环境中持续感知、判断和行动的系统能力。
在双臂操作方向,多个团队展示了从单次动作预测向持续闭环控制的演进路径。TwinFlow-XR1 架构同时输入头部相机、双手腕相机、语言指令和双臂状态数据,由视觉语言模型(VLM)理解场景与任务,动作专家模块承担连续动作预测,并在执行过程中持续重新观察环境、更新后续动作。Lion-VLA 采用统一模型框架覆盖 12 类双臂任务,其核心机制是每执行 8 步即重新观察并规划,通过更短的闭环周期在动作连续性和纠偏之间取得平衡。GOAI residual inference 方案则在基础 VLA 输出之后增加残差动作修正层,系统结合机器人最近几步状态对基础动作进行补偿,并严格限制修正幅度,遇到未支持任务则停止输出。TeamGo 基于 Xiaomi Robotics 1 平台进行双臂操作适配,每次预测 15 步动作,执行前 10 步后重新观察并规划后续动作,同时加入动作平滑、位移与转角限制以及夹爪抖动抑制机制,以提升连续执行的稳定性。
在三维空间理解方向,多个项目将空间表征从隐含能力转化为显式能力。基于 3D 几何特征解耦增强的 VLA 混合模型在 Qwen3-VL 和 Diffusion Transformer 基础上加入视觉几何模型,从多相机画面估计物体距离、方向和位置,并通过 3D-MIX Bridge 将几何信息补充进动作决策。mumu-go 方案接入头部和双手腕三路相机,提高抓取、抬升和放置等关键时刻在训练中的比重。RoboRush 将头部与双腕多相机输入接入完整 VLA 工程链路,从数据处理、训练延伸到远程推理。HUST_HRT 尝试以一套 LoRA 参数覆盖 12 类任务,在统一模型框架下降低多任务适配和部署成本。
在环境泛化能力方向,“草地牛_Robot”方案专门改变训练数据中的物体材质、颜色、反光和光照条件,同时保持物体位置与动作轨迹不变,让模型学习“视觉外观变了但正确动作没变”的映射关系。其训练数据规模从约 1200 段扩展至 4800 段、约 237 万帧,并进行关键缓存质量检查。TEMP 团队围绕三类典型问题改进基线模型:通过关键帧加权强化抓取和放置动作,通过长时序信息增强缓解长任务漂移,通过随机遮挡降低模型对固定视觉特征的依赖。
在全地形巡逻方向,“山猫巡游记”围绕山猫 S10 平台探索复杂园区中的跨地形巡逻;“维金战船”利用轮足结构兼顾规则路面的移动效率与复杂地形中的障碍跨越能力。Tashi Robot Run、炎熵润启、S10-PATROL 和 CAMSUCCESS 均围绕复杂园区中的持续自主巡逻组织整体方案,从仿真和代码验证向完整任务链推进。lidarencoder 修改版 SRU 从激光雷达编码切入,为后续导航、避障和运动控制提供更有效的三维环境表征。
影响分析
对中文开发者与从业者而言,具身智能的技术路线选择已从追求单次任务成功率转向强调动态环境中的持续稳定性。这意味着研发团队必须将闭环控制、三维空间理解、环境泛化和长任务执行作为系统级能力进行协同设计,而非孤立优化单一模块。具体到工程实践,动作生成不能视为一次性决策,必须建立“看到—行动—再看到”的连续循环机制,使机器人在执行后能利用新状态判断物体是否真正抓住、位置是否偏移、前一步动作是否产生预期效果。
对中文开发者而言,这一转变还意味着评估标准的变化。传统 Benchmark 中“识别物体”的单一指标已不足以满足需求,机器人必须能够回答“它在哪里、离机械臂多远、应从哪个方向抓、放在哪里才不会碰撞”等与行动直接相关的空间关系问题。对于初创企业和技术团队,这意味着需要在模型架构设计中预留持续反馈与在线修正的空间,同时积累覆盖不同材质、光照、地形变化的多样化训练数据,以应对真实物理环境中摩擦、执行偏差、传感器噪声等多重干扰因素。这是分析判断,基于 20 支决赛团队的技术方案共性得出。
适用边界
上述结论主要适用于双臂协作操作和全地形巡逻两类任务场景,且基于 GOAI「具身未来 Embodied Future」赛道 20 支决赛团队的技术方案得出。若任务场景涉及极高风险操作(如密闭空间救援、精细外科手术)、超大规模物体交互(如重载物流搬运)或完全未知且高度非结构化的极端环境,本文所述的闭环控制、三维表征与环境泛化策略可能不足以保证任务完成。此外,文中技术路线的有效性依赖于仿真到真机(Sim-to-Real)迁移过程中的充分验证,若真实环境的物理特性与仿真假设存在显著偏差,相关结论需重新评估。
孤本观察
从 20 支决赛团队的技术演进路径来看,具身智能的核心瓶颈已不再局限于单一模型的预测精度,而是系统级感知-决策-执行闭环在动态物理环境中的鲁棒性。这是基于本文事实的编辑判断。





常见问题
Lion-VLA 覆盖多少类双臂任务,其重新观察与规划的频率是多少?
Lion-VLA 覆盖 12 类双臂任务,其核心机制是每执行 8 步即重新观察并规划。
“草地牛_Robot”方案将训练数据扩展到了多少段,约多少帧?
“草地牛_Robot”方案将训练数据从约 1200 段扩展至 4800 段,约 237 万帧。
TeamGo 基于什么平台进行双臂操作适配,每次预测多少步动作?
TeamGo 基于 Xiaomi Robotics 1 平台进行双臂操作适配,每次预测 15 步动作。
GOAI「具身未来 Embodied Future」赛道总决赛将在何时何地举行?
9 月 22 日至 23 日在举行,地点在杭州。
GOAI 决赛团队在双臂操作与全地形巡逻中主要验证了哪些能力?
20 支决赛团队在双臂操作与全地形巡逻中验证了闭环控制与环境泛化能力。
来源:InfoQ 中文 AI