微软开源 TauGrid,为搭载 GPU 的 Kubernetes 集群上的 AI 工作负载提供统一的管理、调度与监控平台。微软表示,该平台面向工程团队和研究团队设计,提供一套统一的技术栈,平台团队可用工作区、队列、计算配置文件、存储、身份认证和可观测性等高级能力,研究人员则无需学习 Kubernetes 即可提交工作负载。
在 Kubernetes 上运行 AI 工作负载,通常需要平台团队自行组装和维护多个开源项目、自定义脚本与运维工具,还要编写这些组件之间的“粘合剂”:提交脚本、队列封装器、健康检查和结果检索。TauGrid 的目标正是免除这些分散的构建与集成工作,通过一次 Helm 安装提供全部功能,并划定清晰的权责边界。
据微软介绍,TauGrid 为 AI 工作负载提供端到端管理,覆盖从初始数据准备到分布式训练、微调和推理的全部环节。它基于 Kubernetes 构建,采用专门的队列和拓扑感知调度技术,以高效管理高强度的 GPU 工作负载。
除 tau 命令行工具外,TauGrid 还集成了 Kueue(用于工作负载排队和资源管理)、KubeRay(用于编排)、GPU 节点健康监控以及可观测性能力。
在使用方式上,TauGrid 通过 yaml 配置文件定义工作负载,并使用 tau run 提交。该命令会验证配置并创建 Kubernetes Job 或 KubeRay RayJob,随后由 Kueue 根据剩余配额和优先级排队。执行过程中,TauGrid 会跟踪工作负载状态、日志和检查点,同时收集并存储实验证据,以便日后复现实验和诊断故障。以下是在单个 A100 GPU 上运行 PyTorch 训练作业的 tau.yaml





来源:InfoQ 中文 AI