一句话结论
亮源新创将人类动作预训练规模扩展至 1200 亿 tokens,验证了误差按幂律下降的迁移缩放定律,显著降低机器人适应新环境成本。
关键要点
- 亮源新创(Light Origins)于 9 月 21 日发布技术博客,提出 Light-O1 模型,其人类动作预训练规模从 37.5 亿扩展至 1200 亿 tokens。
- 在 Light-O1 模型中,随着预训练规模扩大,动作预测、全身姿态及腕部位置误差均呈幂律下降趋势,该现象被称为“迁移缩放定律”。
- 1200 亿 tokens 的预训练规模最大对应约 10 万小时的人类动作数据,数据源自互联网第三视角视频提取的经验。
- 对比行业头部企业 Figure 的 Helix 2.5 系统,后者经 Index 预训练后,在 30 个陌生家庭的零样本任务成功率从 9% 提升至 56%。
- 该迁移缩放定律基于留出数据上的开环评测结果,不直接等同于真实机器人在闭环任务中的实际成功率。
背景与事实
2026 年 9 月 21 日,亮源新创(Light Origins)发布技术博客,正式提出 Light-O1 模型。该模型的核心突破在于将人类动作预训练的数据规模从原有的 37.5 亿 tokens 大幅扩展至 1200 亿 tokens。这一规模的扩展意味着模型处理的人类动作数据量达到了约 10 万小时,这些数据主要提取自互联网上的第三视角视频。通过大规模的人类动作预训练,Light-O1 展示了显著的“迁移缩放定律”:在针对第一视角人类数据、宇树 G1(Unitree G1)机器人以及亮源自研人形机器人的目标域适配实验中,随着预训练规模的扩大,动作预测误差、全身姿态误差和腕部位置误差均呈现出幂律下降的趋势。
在这一技术趋势下,行业头部企业 Figure 在 9 月 17 日展示了其 Helix 2.5 系统在旧金山湾区 30 个陌生家庭中执行零样本任务的能力。零样本任务要求机器人在无需现场重新训练的情况下,面对新环境完成整理客厅、叠毛巾、铺床等任务。对比实验数据显示,同架构模型经过 Figure 建立的 Human Data 供应链 Index 预训练后,在陌生家庭的完整任务成功率从随机初始化的 9% 提升至 56%。Figure 的 Index 预训练数据规模跨度达 8 倍,损失随数据翻倍规律下降,拟合误差约为 0.54%。为支撑这一算力需求,Figure 于 9 月初与英国 Nscale 达成合作,初始承诺 35 亿美元,计划部署最高 10 万颗英伟达 Vera Rubin GPU,未来规模可能超过 60 亿美元。截至 8 月底,Figure 已收到超过 1600 万条视频,并向创作者支付了 1500 万美元。
除了 Figure 和亮源新创,其他技术路线也在并行推进。Dyna Robotics 于 8 月发布 Dyna-2,该模型使用 1000 至 100 万小时的第一视角人类视频进行预训练。在经过后训练适配 14 个真实任务后,Dyna 团队发现平均归一化得分随规模扩大分别达到上限的 20%、28%、45% 和 53%。其中,利用约 10 分钟的机器人示范即完成了瓶盖上旋(Bottle Cap Untwisting)任务。此外,学术界与工业界还探索了多种利用人类视频提取动作信号的方法,例如 CoMo 生成伪动作、HuRo 将人类视频“机器人化”以及 Rhoda 利用因果视频模型与逆动力学预测动作。这些多路径的技术探索共同构成了当前机器人具身智能领域利用大规模人类数据进行预训练的技术图景。
影响分析
对于中文开发者与从业者而言,亮源新创验证的“迁移缩放定律”具有直接的指导意义。这表明,构建机器人基础模型时,单纯增加数据规模是提升性能的有效路径,且性能提升遵循可预测的幂律关系。这意味着研发团队在规划算力与数据预算时,可以更精确地预估投入产出比,避免盲目堆砌数据。然而,必须警惕评测指标与实际应用之间的差距。Light-O1 的结果基于开环评测,而 Figure 和 Dyna 强调闭环任务成功率。中文开发者在实际部署中,不能仅依赖离线误差下降来预判真实家庭环境中的任务成功率,还需考虑实时控制、延迟与传感器噪声等闭环因素。
此外,Figure 在 30 个陌生家庭的成功率提升案例,为数据供应链的商业化提供了参考。尽管亮源新创聚焦于技术原理,但 Figure 通过支付创作者费用建立数据供应链的模式,提示国内从业者需思考如何构建合法、合规且高质量的人类动作数据获取渠道。随着预训练规模从数亿级迈向千亿级,数据清洗、对齐与标注的成本将成为关键瓶颈。对于中小型团队,直接购买或生成 10 万小时级别的高质量人类动作视频可能不具经济性,需探索如 CoMo 或 HuRo 等低成本提取动作信号的技术路线,或通过合作共享数据资源。
适用边界
本文所述结论存在明确的技术边界与适用范围限制。首先,亮源新创提出的“迁移缩放定律”基于留出数据上的开环评测,其反映的误差下降趋势并不直接等同于真实机器人在复杂动态环境中的闭环任务成功率。因此,不能简单将开环误差的低数值线性映射为实际部署中的高可靠性。其次,不同机构的数据定义与评测标准存在差异,例如 Figure 的 Index 预训练与亮源的 1200 亿 tokens 预训练在数据构成、视频视角(第一视角与第三视角)及机器人本体类型上均有所不同,直接横向对比绝对数值需谨慎。最后,Dyna 和 Figure 的成功案例依赖于特定硬件平台与大量后训练适配,该结论可能不适用于算力受限或未配备专门后训练流水线的通用型机器人系统。在将理论规律应用于工程实践时,必须重新验证数据与目标域之间的匹配度。
孤本观察
亮源新创将预训练规模扩展至 1200 亿 tokens 并明确对应约 10 万小时人类动作,这标志着机器人基础模型训练正从“数据稀缺”阶段进入“规模效应”阶段,但开环评测与闭环应用的差距仍是制约其实际落地效应的关键非技术变量。
常见问题
亮源新创 Light-O1 模型的人类动作预训练规模是多少?
亮源新创将 Light-O1 模型的人类动作预训练规模从 37.5 亿 tokens 扩展至 1200 亿 tokens,最大对应约 10 万小时的人类动作数据。
“迁移缩放定律”在 Light-O1 模型中具体表现为什么现象?
在 Light-O1 模型中,随着预训练规模扩大,动作预测、全身姿态及腕部位置误差均呈幂律下降趋势,该现象被称为“迁移缩放定律”。
Figure 的 Helix 2.5 系统在 30 个陌生家庭的零样本任务成功率提升了多少?
Figure 的 Helix 2.5 系统经 Index 预训练后,在 30 个陌生家庭的零样本任务成功率从随机初始化的 9% 提升至 56%。
亮源新创的“迁移缩放定律”评测基于开环还是闭环数据?
该迁移缩放定律基于留出数据上的开环评测结果,不直接等同于真实机器人在闭环任务中的实际成功率。
来源:量子位