孤本网
/ 0 阅读
0
0

SkyRL 框架在 Amazon SageMaker HyperPod 上实现 Qwen3-VL-8B 视觉迷宫任务 RL 后训练加速

一句话结论

SkyRL 框架在 HyperPod 集群上完成 Qwen3-VL-8B 的 GRPO 后训练,将视觉迷宫解决率从 43.75% 提升至 96.875%,验证了云端多模态强化学习训练可行性。

关键要点

  • 集群拓扑由 1 个 CPU 头部节点(ml.r5d.16xlarge,512 GB RAM)和 3 个 GPU 工作节点(ml.g7e.12xlarge,各含 6 块 NVIDIA RTX PRO 6000 Blackwell GPU)组成,基于 Amazon EKS 构建。
  • 模型采用 LoRA(秩 32)微调,通过 PyTorch FSDP 在 6 块 GPU 上分片;推理使用 vLLM 引擎,适配器权重经 Amazon FSx for Lustre 在训练与推理节点间同步。
  • GRPO 后训练将迷宫解决率从基线 43.75%(28/64)提升至峰值 96.875%(62/64,第 160 步),第 100 步时达到 75%;评估集为固定 64 迷宫,`eval_interval=10`。
  • 部署使用 `toolkit-for-ray-on-sagemaker-ai` 包,通过 `sagemaker_ray://` 协议提交任务,无需直连网络;Ray Serve 通过 `build_openai_app` 构建 OpenAI 兼容端点。
  • 关键训练参数:`n_samples_per_prompt=8`,`max_turns=15`,`hf_save_interval=20`,`ckpt_interval=20`;`trainer.placement.colocate_all=true` 使 vLLM 引擎与 FSDP 工作器共享 GPU,`gpu_memory_utilization` 设为 0.45。

背景与事实

本次演示在 Amazon SageMaker HyperPod 上利用开源强化学习框架 SkyRL,对 Qwen3-VL-8B 视觉语言模型执行 Group Relative Policy Optimization(GRPO)后训练。训练基于 VisGym 监督微调(SFT)检查点,目标任务为视觉迷宫求解。HyperPod 提供节点健康监控、自动替换故障节点及断点恢复功能,集群拓扑由 1 个 CPU 头部节点(ml.r5d.16xlarge,512 GB RAM)和 3 个 GPU 工作节点(ml.g7e.12xlarge,各含 6 块 NVIDIA RTX PRO 6000 Blackwell GPU)组成,底层基于 Amazon EKS 构建。

模型微调采用 LoRA(秩 32),通过 PyTorch FSDP 在 6 块 GPU 上分片。推理阶段使用 vLLM 引擎,LoRA 适配器权重经 Amazon FSx for Lustre 在训练与推理节点间同步。关键配置中,`trainer.placement.colocate_all=true` 使 vLLM 引擎与 FSDP 工作器共享同一 GPU 资源,`gpu_memory_utilization` 设为 0.45 以平衡显存占用。训练参数设定为:`n_samples_per_prompt=8`(每提示生成 8 个样本)、`max_turns=15`(最大交互轮次 15)、`hf_save_interval=20`(每 20 步保存 Hugging Face 格式检查点)、`eval_interval=10`(每 10 步在固定 64 迷宫评估集上运行评估)、`ckpt_interval=20`(每 20 步保存检查点)。

评估结果显示,GRPO 后训练显著提升了模型在视觉迷宫任务上的表现:基线解决率为 43.75%(28/64),第 100 步时达到 75%,峰值 96.875%(62/64)出现在第 160 步。部署方面,使用 `toolkit-for-ray-on-sagemaker-ai` 包通过 `sagemaker_ray://` 协议提交 Ray 任务,无需直连网络。Ray Serve 利用 AWS Deep Learning Container 运行大语言模型,通过 `build_openai_app` 构建 OpenAI 兼容端点。`serveConfigV2` 配置中,`model_source` 指向 Amazon FSx 上的基础 SFT 模型(标识为 visgym-qwen3vl),`dynamic_lora_loading_path` 指向 Amazon S3 前缀。Ray Serve 首次请求时从 S3 下载并缓存 LoRA 适配器(标识为 visgym-qwen3vl:maze-grpo),后续请求复用已加载权重。单个部署可同时服务基础模型及 S3 前缀下的所有适配器,通过请求的 `model` 字段选择目标适配器。资源清理需删除 SageMaker Studio 中的 skyrl-visgym Ray 集群及 HyperPod 实例组。该工作流基于 Amazon SageMaker HyperPod、SkyRL、VisGym 及标准 Ray API,可迁移至其他基于 Ray 的强化学习框架。

影响分析

对中文开发者而言,该方案提供了多模态强化学习后训练的云端完整工作流参考。SkyRL 作为开源框架,结合 SageMaker HyperPod 的故障恢复机制,降低了多模态 RL 训练的运维门槛。vLLM 与 FSDP 的 colocate 部署模式及 0.45 显存利用率配置,为资源受限场景下的训练-推理协同提供了可复制的工程范式。OpenAI 兼容端点的构建方式使模型服务可直接接入现有 LLM 应用栈,减少了 API 适配成本。该工作流对视觉语言模型在具身智能、游戏 AI 等场景的强化学习训练具有直接参考价值。

适用边界

该结论仅适用于基于 Ray 生态的多模态 RL 训练场景,且依赖 NVIDIA RTX PRO 6000 Blackwell GPU 及 Amazon FSx for Lustre 的特定硬件与存储配置。对于非 Ray 框架(如原生 PyTorch DDP 或 Horovod)的多模态 RL 训练,部署与服务化方案不适用。此外,`colocate_all=true` 模式要求显存充足以同时承载 vLLM 推理与 FSDP 训练分片,显存受限集群需调整 `gpu_memory_utilization` 或拆分训练与推理资源。该工作流依赖 VisGym 基准,迁移至其他多模态 RL 任务需重新设计奖励函数与评估协议。

孤本观察

该工作流将多模态 RL 训练的集群基础设施、模型分片、推理服务与动态适配器加载整合为单一云端管线,是 Ray 生态在多模态强化学习领域的工程化落地样本。其价值在于以标准化 API 屏蔽了底层资源调度复杂度,为同类任务提供了可迁移的部署模板。

常见问题

SkyRL 框架在 HyperPod 上训练 Qwen3-VL-8B 使用的 GPU 型号及数量是多少?

集群包含 3 个 GPU 工作节点,每个节点配备 6 块 NVIDIA RTX PRO 6000 Blackwell GPU,共计 18 块 GPU。

GRPO 后训练使视觉迷宫解决率从多少提升至多少?

解决率从基线的 43.75%(28/64)提升至峰值 96.875%(62/64),该峰值出现在训练的第 160 步。

部署模型服务时使用的 Ray 任务提交协议是什么?

使用 `sagemaker_ray://` 协议通过 `toolkit-for-ray-on-sagemaker-ai` 包提交任务,无需直连网络。

当显存受限时,如何调整 `colocate_all=true` 模式的配置?

需调整 `gpu_memory_utilization` 参数或拆分训练与推理资源,因为该模式要求显存充足以同时承载 vLLM 推理与 FSDP 训练分片。

该工作流不适用于哪些多模态强化学习训练框架?

不适用于非 Ray 框架(如原生 PyTorch DDP 或 Horovod),因为其部署与服务化方案依赖 Ray 生态。

来源:AWS Machine Learning Blog


评论