孤本网
发布于 2026-09-20 / 0 阅读
0
0

微软开源 TauGrid,统一管理 Kubernetes 上的 AI 工作负载

微软开源 TauGrid,为搭载 GPU 的 Kubernetes 集群上的 AI 工作负载提供统一的管理、调度与监控平台。微软表示,该平台面向工程团队和研究团队设计,提供一套统一的技术栈,平台团队可用工作区、队列、计算配置文件、存储、身份认证和可观测性等高级能力,研究人员则无需学习 Kubernetes 即可提交工作负载。

在 Kubernetes 上运行 AI 工作负载,通常需要平台团队自行组装和维护多个开源项目、自定义脚本与运维工具,还要编写这些组件之间的“粘合剂”:提交脚本、队列封装器、健康检查和结果检索。TauGrid 的目标正是免除这些分散的构建与集成工作,通过一次 Helm 安装提供全部功能,并划定清晰的权责边界。

据微软介绍,TauGrid 为 AI 工作负载提供端到端管理,覆盖从初始数据准备到分布式训练、微调和推理的全部环节。它基于 Kubernetes 构建,采用专门的队列和拓扑感知调度技术,以高效管理高强度的 GPU 工作负载。

除 tau 命令行工具外,TauGrid 还集成了 Kueue(用于工作负载排队和资源管理)、KubeRay(用于编排)、GPU 节点健康监控以及可观测性能力。

在使用方式上,TauGrid 通过 yaml 配置文件定义工作负载,并使用 tau run 提交。该命令会验证配置并创建 Kubernetes Job 或 KubeRay RayJob,随后由 Kueue 根据剩余配额和优先级排队。执行过程中,TauGrid 会跟踪工作负载状态、日志和检查点,同时收集并存储实验证据,以便日后复现实验和诊断故障。以下是在单个 A100 GPU 上运行 PyTorch 训练作业的 tau.yaml

微软开源 TauGrid,统一管理 Kubernetes 上的 AI 工作负载

微软开源 TauGrid,统一管理 Kubernetes 上的 AI 工作负载

微软开源 TauGrid,统一管理 Kubernetes 上的 AI 工作负载

微软开源 TauGrid,统一管理 Kubernetes 上的 AI 工作负载

微软开源 TauGrid,统一管理 Kubernetes 上的 AI 工作负载

来源:InfoQ 中文 AI


评论