学习路线
本路线面向已经具备 Kubernetes / Linux 基础,希望成长为 AI Infrastructure 工程师的读者。
阶段一:夯实基础(4~8 周)
目标:建立 AI 基础设施所需的底层知识。
- 大模型从 0 到 1(已上线) — 用通俗易懂的方式走完数据 → Tokenizer → Transformer → 预训练 → 后训练 → 推理服务 → 优化加速的完整旅程
- Linux 系统与性能调优(已上线) — 从 Kernel/User Space、系统调用到 CFS 调度器、虚拟内存/TLB/HugePages/NUMA、VFS/I/O 调度、网络协议栈、cgroup v2/namespace,配合 CPU 可运行 Mini Demo,建立 AI Infra 的 OS 底盘直觉
- 存储系统(已上线) — 从块/文件/对象三种存储语义、一致性、复制与纠删码,到 DAS/NAS/SAN/对象存储/并行文件系统、Kubernetes PV/PVC/StorageClass/CSI、PyTorch Distributed Checkpoint,配合 CPU 可运行 Mini Demo,建立 AI 训练 checkpoint 与推理模型加载的存储直觉
- GPU 架构与 CUDA 基础(已上线) — 从 SIMT/Warp/SM 到 CUDA 编程模型,从 Fermi 到 Blackwell 架构演进,从 cuBLAS/NCCL 到 DCGM 生产监控
- 分布式系统基础(已上线) — 一致性、容错、通信、复制、共识、分布式事务、分布式锁、幂等、时钟与顺序
阶段二:掌握云原生(4~6 周)
目标:能够在 Kubernetes 上构建和运维平台。
- Kubernetes(已上线) — 声明式 API、控制循环、调度框架、GPU/Gang 调度、生产实践
- 容器运行时(已上线) — K8s 之下的执行层:namespace/cgroup/overlayfs、OCI 标准、containerd/runc 分层、镜像优化与供应链安全、沙箱运行时、惰性拉取
- Helm(已上线) — K8s 包管理器:Chart/values/template/Release 四要素、Tiller 移除与客户端渲染、三方合并 Patch、OCI 仓库、GitOps 部署
- Operator 模式(已上线) — 把领域运维知识编码成控制循环:CRD/Controller/Reconcile 四铁律、controller-runtime 架构、finalizer/owner/status/webhook、KubeRay/Training Operator/GPU Operator 源码对照
- CNI / CSI 深度(已上线) — Kubernetes 把网络与存储外包给插件的两根柱子:CNI 接口与插件链(bridge/host-local/IPAM/Flannel/Calico/Cilium/Multus/SR-IOV)、CSI Identity/Controller/Node 三面 gRPC、external-provisioner/attacher/resizer/snapshotter 侧车、NetworkPolicy 数据面、VolumeAttachment 一致性、RWO/ROX/RWX、生产排障与 AI 场景选型
- GPU 在 Kubernetes 上的调度(已上线) — 把 NVIDIA GPU 作为 K8s 一等资源:Device Plugin gRPC 协议、GPU Operator 组件编排、
nvidia.com/gpu资源模型、MIG/MPS/time-slicing、拓扑感知调度、Gang/队列/公平调度、多租户治理与生产排障
阶段三:AI 平台与 LLMOps(6~10 周)
目标:理解模型训练、推理、服务的完整链路。
- Ray(已上线) / MLflow(已上线) / KubeRay(已上线) / Airflow(已上线) — 分布式 AI 计算、ML 生命周期管理、K8s 上的 Ray 平台与工作流编排
- KServe(已上线) — Kubernetes 模型服务平台:InferenceService + ServingRuntime + InferenceGraph、协议统一、扩缩、金丝雀、多 runtime 编排
- Kubeflow(已上线) — Kubernetes 上的 ML 平台:Notebook + Pipelines + Katib + Training Operator + KServe + Central Dashboard,覆盖 ML 全生命周期
- 模型服务与推理优化
- vLLM(已上线)
- SGLang(已上线)
- TensorRT-LLM(已上线)
- Triton Inference Server(已上线)
- LLM Gateway(已上线)
- RL Post-Training 基础设施(已上线) — GRPO/PPO 算法工程化、Rollout/Train 分离架构、veRL/OpenRLHF 源码、Agentic RL、生产实践
阶段四:Agent 与 RAG(4~6 周)
目标:理解大模型应用的基础设施需求。
- Agent Runtime(已上线)
- Memory(已上线)
- Multi-Agent(已上线)
- Reflection(已上线)
- MCP(已上线)
- Planning(已上线)
- Tool Use(已上线)
- Agent OS(已上线)
- RAG(已上线)
- Embedding、Retriever、Hybrid Search
- GraphRAG 与评估体系
阶段五:AI SRE 与安全(持续)
目标:让 AI 系统在生产环境中稳定、安全、可观测。
- AI SRE(已上线)
- Benchmark + Evaluation(已上线) — Agent / LLM / RAG 的可复现评测框架:trace-based eval、benchmark 数据集、CI 评估门与生产回归检测
- 安全(已上线)
- OpenTelemetry 与可观测性
- SLO / Error Budget
- AIOps 与事件响应
- IAM、Secrets、Zero Trust
- 合规(SOC2、HIPAA、GDPR)
阶段六:案例研究(持续)
目标:从真实公司的工程实践中提炼可复用的设计原则。
- OpenAI 案例研究(已上线) — 训练/推理基础设施、模型安全与对齐、产品化工程经验
- Anthropic 案例研究(已上线) — 宪法对齐/RLAIF、机制可解释性、Trainium/Colossus 异构算力、prompt caching 与 RSP/ASL 治理
- Meta 案例研究(已上线) — 开放权重、OCP 硬件协同设计(Grand Teton/Catalina/MTIA)、RoCE/InfiniBand 双网络织物、SDC 治理与 >95% 有效训练时间、Llama Stack
- Google 案例研究(已上线) — TPU 自研硅(MXU/SparseCore/3D-torus/OCS)、NSDI'24 双路径恢复(99.98% 可用率)、GSPMD/Pathways 自动并行、Falcon 硬件传输、开放软件栈(JAX/XLA/MaxText)+ 闭源硬件
- Cursor、Perplexity 等持续建设中
推荐学习顺序
如果你时间有限,建议按以下优先级:
- vLLM — 理解 LLM 推理的核心挑战
- SGLang — 理解 LLM Program、RadixAttention 与结构化生成
- TensorRT-LLM — 理解 NVIDIA 编译型推理引擎与生产部署
- Kubernetes 与 GPU 调度 — 理解 AI 平台的底座
- 容器运行时 — 理解 K8s 之下"把镜像变成进程"的那一层
- Helm — 理解 K8s 包管理、Chart 模板、三方合并与 GitOps 部署
- Operator 模式 — 理解 CRD + 控制循环、Reconcile 四铁律、finalizer/owner/status,以及 AI 平台(KubeRay/Training Operator/KServe)如何用它实现自管理
- Ray — 理解分布式 AI 计算
- KServe — 理解 Kubernetes 模型服务平台与 runtime 编排
- Kubeflow — 理解 Kubernetes 上的 ML 全生命周期平台
- MLflow — 理解开源 ML 生命周期平台:实验追踪、模型打包与 Model Registry 治理
- KubeRay — 理解 Ray 官方 Kubernetes Operator:RayCluster / RayJob / RayService、自动扩缩容、GCS FT 与声明式升级
- Airflow — 理解工作流编排平台:DAG / Operator / Scheduler / Executor / Metadata DB / Triggerer / XCom / Deferrable Operator
- OpenTelemetry — 理解 AI 系统可观测性
- LLM Gateway — 理解多供应商/多引擎的统一接入层
- Agent Runtime — 理解 Agent 时代的执行容器与 ReAct 循环
- Memory — 理解 Agent 的记忆系统与长期上下文管理
- Multi-Agent — 理解多 Agent 协作、角色定义与协调调度
- Reflection — 理解 Agent 自我反思、批判与质量提升闭环
- MCP — 理解 Agent 协议、工具发现与跨模型能力复用
- Planning — 理解 Agent 任务分解、计划表示与动态重规划
- Tool Use — 理解 Agent 工具调用、Schema、解析、执行与可观测
- Agent OS — 理解 Agent 运行时操作系统、进程调度、沙箱、Workspace 与多 Agent 治理
- RAG — 理解外部知识检索、向量索引、混合检索与检索增强生成
- AI SRE — 理解 AI 系统可观测性、SLO、AIOps 与事故响应
- 安全 — 理解 AI 系统身份、密钥、零信任、Guardrails、合规与事件响应
- OpenAI 案例研究 — 通过 OpenAI 的演化理解训练/推理基础设施、安全对齐与产品化工程落地
- Anthropic 案例研究 — 通过 Anthropic 理解宪法对齐、机制可解释性、异构算力、prompt caching 与 RSP/ASL 安全治理
- Meta 案例研究 — 通过 Meta 理解开放权重、硬件协同设计、双网络织物、同步训练可靠性(SDC 治理/>95% 有效训练时间)与 MTIA 自研硅
- Google 案例研究 — 通过 Google 理解 TPU 自研硅、OCS 可重配拓扑、NSDI'24 双路径恢复、GSPMD/Pathways 编译器自动并行与开放软件栈
面试准备
参考 面试指南。