11. 延伸阅读
官方文档
关键概念文档
- InferenceService API
- ServingRuntime / ClusterServingRuntime
- InferenceGraph
- Data Plane Protocol
- Architecture
- Autoscaling
- Canary Rollout
- ModelMesh
相关主题(本手册内)
| 主题 | 关系 | 链接 |
|---|---|---|
| Operator 模式 | KServe 本身就是 Operator | Operator 模式 |
| Kubernetes | KServe 的底座与调度层 | Kubernetes |
| vLLM | KServe 的 LLM runtime 之一 | vLLM |
| Triton | KServe 的多 backend runtime | Triton |
| Ray | 可与 KServe 互补的分布式平台 | Ray |
| Kubeflow | KServe 是 Kubeflow 的服务组件,可组合成完整 ML 平台 | Kubeflow |
| MLflow | 实验追踪与模型注册,KServe 可加载 MLflow 模型 | MLflow |
| KubeRay | Ray 在 K8s 上的 Operator,可与 KServe 组合 | KubeRay |
| Airflow | 工作流编排;可编排 KServe 部署流水线 | Airflow |
| LLM Gateway | 可与 KServe 端点组合 | LLM Gateway |
| AI SRE | KServe 的可观测与 SLO | AI SRE |
论文与博客
- KFServing becomes KServe —— KServe 改名与项目拆分历史。
- Knative Serving: Scale to Zero —— 缩到零机制。
- Triton Inference Server Architecture —— Triton 作为 KServe runtime 的架构。
- vLLM: Easy, Fast, and Cheap LLM Serving with PagedAttention —— vLLM 底层原理。
生态工具
| 工具 | 用途 |
|---|---|
| Kustomize | KServe 安装配置管理 |
| Istio | KServe 默认服务网格与网关 |
| Kourier | Knative 轻量级入口 |
| Prometheus + Grafana | 指标与可视化 |
| KEDA | 事件驱动扩缩 |
| Locust / k6 | 压力测试 |
学习路径建议
- 先修:Kubernetes CRD/Operator、Docker、HTTP/gRPC、Prometheus。
- 本主题:通读本主题 11 章 + 跑 mini-demo。
- 动手:在本地 kind/minikube 部署 KServe,发布一个 sklearn 和 HuggingFace 模型。
- 进阶:读
kserve/kservecontroller 源码,尝试自定义 runtime。 - 生产:阅读官方 admin 文档,搭建多租户、可观测、金丝雀完整方案。
一句话总结
KServe 是连接 K8s 与 AI 推理的桥梁:官方文档是它的使用手册,源码是它的实现地图,相邻主题(Operator/Kubernetes/vLLM/Triton/AI SRE)共同构成完整的 AI 平台知识拼图。