11. 延伸阅读与总结
一句话理解:KubeRay 不是孤立的 Operator,它与 Ray、Kubernetes、Operator 模式、KServe、MLflow、Kueue、Volcano、Prometheus 共同构成完整的 AI 平台拼图。
11.1 核心官方资源
| 资源 | 说明 |
|---|---|
| KubeRay Docs | 官方文档首页 |
| Ray on Kubernetes | Ray 官方 K8s 指南 |
| KubeRay GitHub | 源码与 release note |
| KubeRay API Reference | CRD 字段参考 |
| Ray Cluster Key Concepts | Ray 核心概念 |
11.2 相邻主题交叉引用
| 主题 | 关系 | 链接 |
|---|---|---|
| Ray | KubeRay 是 Ray 在 K8s 上的部署形态 | Ray 总览 |
| Kubernetes | KubeRay 的底座 | Kubernetes 总览 |
| Operator 模式 | KubeRay 本身就是 Operator | Operator 模式总览 |
| KServe | 可加载 Ray Serve 端点 | KServe 总览 |
| GPU 在 Kubernetes 上的调度 | KubeRay 的 RayCluster/Worker 需要 GPU 资源;本主题覆盖 K8s GPU 调度、MIG/MPS、拓扑感知、Gang 调度 | GPU 在 Kubernetes 上的调度总览 |
| MLflow | 训练实验追踪与模型注册 | MLflow 总览 |
| Airflow | 工作流编排;Ray 作业可作为 Airflow 任务执行 | Airflow 总览 |
| AI SRE | 可观测、SLO、告警 | AI SRE 总览 |
11.3 关键工程指南
11.4 推荐学习路径
- 第 1 周:精读本主题 01-05 章,理解 CRD、架构、模块与工作流。
- 第 2 周:阅读 06 源码分析 + 07 Mini Demo;尝试本地 kind 安装 KubeRay Operator。
- 第 3 周:实践 GCS FT、GPU worker group、Autoscaler V2、RayService 升级。
- 第 4 周:阅读 KubeRay release note 与源码,关注 v1.6 新特性(History Server、RBAC、CronJob)。
11.5 一句话总结
KubeRay 让 Ray 集群成为 Kubernetes 中的一等公民:你写一份 YAML 描述 desired state,Operator 负责把 Head、Worker、Service、Autoscaler、Job、Serve 全部调和到现实状态,并在故障时自动恢复。
本章小结
- 官方文档、GitHub、API Reference 是最权威的学习来源。
- KubeRay 与 Ray、K8s、Operator、KServe、MLflow、AI SRE 等主题紧密相连。
- 学习路径:理论 → Mini Demo → 本地 kind → 生产实践 → 源码。
参考来源