孤本网
/ 0 阅读
0

灵初智能发布Psi-R2.5,聚焦人类与机器人数据对齐以提升部署效率

一句话结论

灵初智能发布Psi-R2.5模型,通过逆向生成配对数据与上下文学习方法,解决了人机动作不对齐痛点,显著降低机器人客户现场适配成本。

关键要点

  • 灵初智能推出Psi-W0逆向应用方案,从真实机器人数据生成对应人手操作,构建“强配对数据”,解决关节结构与摩擦条件差异导致的动作不可回放问题。
  • Psi-R2.5采用双层架构,上层拆解长程任务,下层输出操作轨迹;结合In-Context Learning(ICL)机制,允许通过视频示范即时引导机器人行为,无需重新训练模型参数。
  • 在数据质量优化方面,模型减少同一任务重复堆积,增加任务多样性,并通过自动标注管线将任务拆解至原子动作层面,提升训练数据覆盖度。
  • 针对手机盒装配等精细化任务,结合人工参与与强化学习的后训练框架,经1-2个工作日迭代后,任务成功率达到约99%。

背景与事实

在上周Figure发布Helix 2.5并强调使用人类行为数据集Index进行预训练的背景下,灵初智能指出了当前机器人学习领域的核心瓶颈:人类操作数据不能直接被机器人使用。尽管人类拥有大量操作经验,但由于人手与机械手在关节结构、接触物体时的摩擦条件以及姿态估计误差上存在本质差异,直接转换人类轨迹往往无法在真机上成功回放。

为解决这一难题,灵初智能定义了“强配对数据”概念,要求人和机器人不仅执行相同任务,且场景基本一致、动作时序逐帧对应,并确认可在真机回放。此前,灵初智能尝试通过Psi-R2与世界模型Psi-W0配合,利用轨迹推演和强化学习将人类操作转换为机器人数据,但该流程涉及多模型协同,生产较重。

此次发布的Psi-R2.5采用了逆向思路:以真实机器人操作的图像和动作数据为起点,利用Psi-W0生成对应的人手操作数据。这种逆向生成的高质量配对数据随后用于训练端到端转换器。该转换器并非决策策略模型,而是一个带动作输出的视频编辑模型,其输入为人类操作数据,输出为匹配的机器人图像和动作序列。验证方式包括在真机上直接回放转换后的轨迹以确认任务完成度,以及将转换后数据用于后训练并测试模型表现。

此外,Psi-R2.5引入了上下文学习(ICL)机制。这一机制允许机器人根据当前上下文提供的视觉示范(如手机拍摄的人手操作视频),推断具体任务的操作方式,而无需更新模型参数。这与双层架构相衔接:上层模型负责拆解长程指令为子任务,下层模型结合子任务和当前观测输出具体轨迹。在部署环节,针对客户现场特定的物品种类和作业节拍,基础模型通过少量数据补充和强化学习即可快速适配,例如手机盒装配任务在经历1-2个工作日的迭代后,成功率稳定在99%左右。

影响分析

对于中文开发者与从业者而言,这一进展具有显著的工程价值。首先,数据获取成本的降低将直接影响机器人项目的可行性。过去需要大量人工标注和复杂的仿真环境来生成有效训练数据,而灵初智能的方案表明,通过逆向生成配对数据,可以利用现有的机器人真实操作日志反向推导人类示范,大幅减少了数据生产的复杂性。其次,上下文学习机制为机器人交互方式带来了革新。开发者不再局限于静态指令集,而是可以通过提供视频示范来动态调整机器人行为,这意味着现场调试可以从“代码修改”转向“示范引导”,降低了非专业人员的操作门槛。最后,从十万小时级预训练到特定任务1-2天即可达99%成功率的闭环,证明基础模型的复用性正在增强,后续部署的边际成本有望进一步压缩,这将加速具身智能在工业装配、物流分拣等场景的商业化落地。

适用边界

该结论的适用范围主要局限于具备特定硬件条件的任务场景。灵初智能强调的是“强配对数据”和“原子动作”拆解,这意味着对于极度非结构化、缺乏清晰物理规律或依赖复杂语义理解的开放环境任务,单一的视频示范或逆向生成数据可能不足以完全覆盖所需的泛化能力。此外,上下文学习(ICL)目前展示的是特定任务中的能力,更多实现细节尚未完全公开,因此在高动态、高实时性要求或极端长尾场景下的鲁棒性仍需通过实际部署数据来验证。

孤本观察

值得注意的是,灵初智能选择“逆向思维”而非传统的“正向模拟”路径,这反映了对数据生产效率的深层考量。通过以机器人真实动作为锚点反向生成人类数据,不仅规避了仿真到现实(Sim-to-Real)的巨大鸿沟,更将数据生成的主动权从“模拟人”转移到了“校验机器人”,这是一种极具工程实用主义的范式转变。

常见问题

Psi-R2.5模型在解决人机动作对齐时采用了什么核心逆向技术路径?

以真实机器人操作的图像和动作数据为起点,利用Psi-W0生成对应的人手操作数据,构建强配对数据用于训练端到端转换器。

Psi-R2.5的上下文学习(ICL)机制如何改变机器人的现场适配方式?

允许机器人通过视觉示范即时引导行为,无需更新模型参数,使现场调试从代码修改转向示范引导,降低非专业人员操作门槛。

在针对手机盒装配任务的部署中,Psi-R2.5达到99%成功率需要多少迭代时间?

针对客户现场特定物品种类和作业节拍,基础模型通过少量数据补充和强化学习,经历1-2个工作日的迭代后,任务成功率稳定在99%左右。

“强配对数据”在传统机器人数据生产中面临的主要技术瓶颈是什么?

人手与机械手在关节结构、接触物体时的摩擦条件以及姿态估计误差上存在本质差异,直接转换人类轨迹往往无法在真机上成功回放。

Psi-R2.5模型架构分为哪两层,各自承担什么功能?

采用双层架构,上层负责拆解长程指令为子任务,下层模型结合子任务和当前观测输出具体的操作轨迹。

来源:量子位