孤本网
/ 0 阅读
0
0

索辰科技与美梦空间发布具身智能物理模型及测评基准,直击 VLA 模型物理感知盲区

一句话结论

美梦空间发布 Physical-WAM 模型与 RoboTwin-Phys 基准,通过引入物理 Token 与物理漂移评测,解决具身智能缺乏物理预判能力的商业化瓶颈。

关键要点

  • 美梦空间发布业内首个具备物理感知能力的基模 Physical-WAM,核心在于感知与动作链路间插入“物理 Token”表征层。
  • Physical-WAM 由 PhysLens、PhysDream、PhysAct 三模块构成,分别负责物理提取、未来状态推演及物理条件化动作修正。
  • 业内首个物理漂移评测基准 RoboTwin-Phys 已开源,包含 13 类物理扰动因素,支持单因素到多因素组合测评。
  • 物理交互数据因采集成本高仅维持百万量级,较文本图像领域存在数万倍落差,制约现有 VLA 模型泛化能力。
  • 索辰科技(688507.SH)于 2026 年 8 月完成对美梦空间独家种子轮投资,双方在数据、算力及技术层面进行深度协同。

背景与事实

具身智能商业化进程遭遇物理理解瓶颈。北京大学与 BeingBeyond 联合发布的 BeTTER 基准指出,现有视觉 - 语言 - 动作(VLA)模型在静态测试中表现尚可,但引入空间布局偏移或时序外推干预后成功率断崖式下跌。斯坦福大学研究进一步揭示,在接触丰富任务中,VLA 存在“精度失效”与“力失效”两个独立失效模式。这意味着机器人仅能模仿统计规律,无法感知物体材质、摩擦力及重心变化等物理变量,无法预判动作后果。

在此背景下,2026 年 9 月 26 日,杭州美梦空间科技有限公司(Memo)在第五届全球数字贸易博览会首发首秀主舞台上,发布两项核心成果:Physical-WAM 物理 - 世界动作模型与 RoboTwin-Phys 物理漂移评测基准。美梦空间由北京大学高文院士领衔的 AVS 先进视觉系统研究中心孵化。2026 年 8 月,物理 AI 企业索辰科技(688507.SH)完成对美梦空间独家种子轮战略投资,双方共同推进世界模型研发落地。

针对机器人物理交互数据稀缺且迁移壁垒高的痛点,Physical-WAM 架构在感知信号输入与动作输出链路间,插入“物理 Token”表征层。该架构包含三个核心模块:PhysLens 作为物理翻译器,从多模态信号中提取摩擦、重量、重心等不可直接观测的物理信息;PhysDream 作为物理预言家,结合当前状态与候选动作推演未来物理状态,预测打滑、脱手风险;PhysAct 负责生成物理条件化动作,在环境物理漂移时自动修正执行策略。以抓取纸杯注水为例,系统可识别低刚度特性,预判注水后杯壁形变风险,并实时调整抓握力度。

RoboTwin-Phys 评测基准旨在填补现有评测只关注任务完成度而忽视物理适应度的结构性盲区。该基准在 RoboTwin 基础上新增 13 类真实物理扰动因素,涵盖物体属性、接触属性、阻尼、任务环境及相机配置五大维度。其工程价值体现在提供物理真值、接触力日志等深度数据,支持固定种子配对评估,并按推断准确性、扰动成功率、性能上界逐层递进评测。目前 RoboTwin-Phys 已发布开源,项目代码、数据集与排行榜全部开放,支持第三方验证复现。

影响分析

这是分析判断:Physical-WAM 与 RoboTwin-Phys 的发布,标志着具身智能研发范式从“行为模仿”向“物理理解”的实质性转变。对于中文开发者而言,最大的实际影响在于评测标准的统一与开源。RoboTwin-Phys 的开源直接降低了物理 AI 能力验证的门槛,开发者无需从零搭建高保真物理仿真环境,即可量化模型对摩擦、质量等扰动的鲁棒性。

其次,索辰科技的产业资本介入加速了物理数据基础设施的落地。由于物理交互数据生产成本远高于文本图像,美梦空间与索辰科技在数据、算力层面的协同,有望缓解行业普遍面临的数据饥饿问题。开发者可基于开源的 RoboTwin-Phys 排行榜进行模型选型,将研发重心从单纯的视觉感知转向物理状态预测与动作生成,从而提升机器人在非标准工况下的任务成功率。

适用边界

需注意,上述结论与技术优势存在明确的适用边界。Physical-WAM 当前依赖多模态感知信号提取物理 Token,其物理推断精度受限于现有传感器对不可直接观测物理量的捕获能力。在极端物理场景如织物大变形、颗粒材料流动等仿真引擎无法精确建模的领域,PhysDream 的推演闭环鲁棒性面临天花板。此外,跨本体迁移方面,同一物体针对二指夹爪与灵巧手所需的动作策略差异巨大,当前架构在不同末端执行器形态与动力学特性间的适配一致性尚未经过充分验证,不能直接假设其可无损迁移至任意异构机器人本体。

孤本观察

这是判断:美梦空间选择将“物理 Token”作为连接感知与动作的显式中间层,是对 VLA 黑盒路径的实质性技术切割。RoboTwin-Phys 将抽象物理参数转化为可控变量,为具身智能建立了一级标准测试集,试图在物理 AI 领域复刻传统 NLP 领域的 GLUE 基准地位。

常见问题

Physical-WAM模型的三个核心模块分别叫什么,各有什么功能?

三模块为PhysLens(物理提取)、PhysDream(未来状态推演)及PhysAct(物理条件化动作修正)。

RoboTwin-Phys基准包含多少类物理扰动因素,是否已开源?

包含13类物理扰动因素,项目代码、数据集与排行榜已全部开源。

索辰科技何时完成对美梦空间的投资,投资轮次是什么?

2026年8月完成独家种子轮战略投资。

Physical-WAM架构在感知与动作链路间插入了什么关键表征层?

插入了“物理Token”表征层,用于提取摩擦、重量等物理信息。

物理交互数据量与文本图像领域相比存在多大落差?

物理交互数据仅百万量级,与文本图像领域存在数万倍落差。

来源:量子位


评论