孤本网
/ 0 阅读
0

清华联合无问芯穹开源RLark,5分钟纳管机器人并10秒启动跨集群任务

一句话结论

清华联合无问芯穹开源具身智能云原生平台RLark,实现5分钟设备纳管、10秒跨集群任务启动,支撑高效闭环实验。

关键要点

  • 平台RLark支持3个集群、近百个云边端节点统一纳管,覆盖4种型号具身设备。
  • 设备纳管时间从小时级缩短至约5分钟,任务提交后10秒内完成启动。
  • 广东与北京跨地域实测中,连续运行36分钟完成323个全局训练步骤。
  • 受限网络下大包单流吞吐较VPN提升49%,高带宽环境接近2 Gbps。
  • 任务编排采用Job、Task、Worker三层模型,支持声明式配置与API接入。

背景与事实

2026年9月,清华大学(Tsinghua University)联合无问芯穹(Infinigence AI)开源了具身智能云原生平台RLark。该平台定位于为机器人、相机等具身设备提供可扩展、可复用的云原生基础设施,核心组件包括具身设备运行时(embodied-runtime)和任务级跨集群网络互联技术,可将物理设备转化为可调度计算资源。平台支持管理员通过Web控制台管理集群、节点、设备信息及基础组件,研发人员可配置采集、训练及评测任务,并利用工作流、通信域、存储、日志及远程终端管理执行过程,同时提供API以接入既有算法框架与研发工具链。

在广东与北京跨地域实测中,结合RLinf框架,实验连续运行约36分钟,完成323个全局训练步骤,实现了从数据采集、模型训练到结果验证的完整闭环。通信测试数据显示,在受限网络条件下,大包单流吞吐较传统VPN方案提升约49%,小包吞吐提升约14%;在高带宽环境下,大包单流吞吐接近2 Gbps。技术架构采用控制面与数据面分离设计,利用虚拟寻址、gVisor用户态网络栈及SSH安全隧道优化跨集群通信,确保数据传输效率与安全性。

RLark的任务编排采用Job、Task、Worker三层模型,支持声明式配置,使研发人员能够以配置文件形式定义任务逻辑,降低编程复杂度。平台已完成3个集群、近百个云边端节点的统一纳管,覆盖4种型号具身设备,设备纳管时间从小时级缩短至约5分钟,任务提交后10秒内即可启动。开源地址为github.com/RLinf/RLark,官方文档位于rlark.readthedocs.io,便于开发者快速部署与二次开发。

影响分析

对中文具身智能开发者而言,RLark的开源显著降低了多集群实验基础设施的搭建门槛。过去,团队自建跨地域机器人实验环境需数小时完成设备注册与网络调优,如今通过RLark的标准化运行时与网络互联技术,这一过程压缩至5分钟内完成,使小团队也能快速开展分布式采集与训练实验。对于算法研究者,Job、Task、Worker三层编排模型与API接口意味着可将既有PyTorch或TensorFlow训练流程无缝接入,无需重写底层调度逻辑,从而将精力聚焦于模型本身而非基础设施。

对企业与产业从业者,RLark的跨集群通信优化(大包吞吐提升49%)直接降低了广域网实验的延迟瓶颈,使位于不同城市的研发与生产节点能够协同工作。这一能力对机器人制造商尤为关键,可在工厂部署数据采集节点,同步在北京或广东的云端完成模型训练与验证,形成“产训分离”的高效工作流。平台后续将完善设备与芯片适配、轻量运行时及任务异常恢复功能,并邀请机器人及芯片厂商参与设备适配,算法团队分享数据采集、训练及验证场景,基础设施开发者参与任务编排、网络与运行观测能力建设,形成生态共建模式。

适用边界

RLark的核心优势在于具身智能场景下的跨集群设备纳管与任务调度,不适用于纯软件算法训练或云端大规模GPU集群场景。对于已部署单一集群内且设备型号固定的团队,RLark的多集群网络互联与设备运行时带来的性能提升有限,其价值主要体现在跨地域、多型号、动态扩缩容的实验环境中。此外,平台当前覆盖4种型号具身设备,其他特殊硬件需通过设备适配流程支持,在未完成适配前不应直接用于生产环境。gVisor用户态网络栈虽优化了跨集群通信,但在极高并发小包场景下可能引入额外延迟,对实时性要求超过毫秒级的机器人控制回路需评估是否适用。

孤本观察

RLark将“设备纳管时间”与“任务启动延迟”作为核心性能指标,而非传统的吞吐或精度指标,这反映了具身智能基础设施评估逻辑的根本转变:从计算密集型转向设备调度密集型。这一判断基于平台将物理设备转化为可调度资源的设计哲学,意味着未来机器人云原生平台的竞争焦点将从算力规模转向设备接入效率与跨集群协同能力。

常见问题

RLark平台的设备纳管时间和任务启动时间分别是多少?

设备纳管时间从小时级缩短至约5分钟,任务提交后10秒内完成启动。

RLark在受限网络下的大包单流吞吐较VPN提升了多少?

在受限网络条件下,大包单流吞吐较传统VPN方案提升约49%。

RLark任务编排模型包含哪三层?

任务编排采用Job、Task、Worker三层模型,支持声明式配置与API接入。

RLark平台目前纳管了多少个集群和节点?覆盖几种设备?

平台已支持3个集群、近百个云边端节点统一纳管,覆盖4种型号具身设备。

RLark不适用于哪些场景?

RLark不适用于纯软件算法训练或云端大规模GPU集群场景,也不适用于单一集群内设备型号固定的团队。

来源:量子位