一句话理解
AI Infra Handbook 不是教程合集,而是一本面向 AI 基础设施工程师的长期维护的工程手册。
它帮助一名已经具备 Kubernetes / Linux 基础的工程师,成长为能够设计和构建 AI 基础设施的平台工程师、LLMOps Engineer 或 AI SRE。
当前进度
- [x] 项目骨架与 VitePress 初始化
- [x] 大模型从 0 到 1 主题(数据 → Tokenizer → Transformer → 预训练 → 后训练 → 推理服务 → 优化加速)
- [x] GPU/CUDA 主题(硬件架构、CUDA 编程模型、NVIDIA 软件栈、生产实践)
- [x] Linux 系统与性能调优主题(Kernel/User Space、进程调度、内存管理、I/O、网络、cgroup/namespace、性能分析,含 CPU 可运行 Mini Demo)
- [x] 计算机网络主题(OSI/TCP-IP、分组交换、可靠传输、拥塞控制、数据中心拓扑、RDMA/RoCE/InfiniBand、K8s CNI/Service/DNS/LB,含 CPU 可运行 Mini Demo)
- [x] 存储系统主题(块/文件/对象、一致性、复制与纠删码、DAS/NAS/SAN/并行文件系统、K8s CSI、PyTorch DCP,含 CPU 可运行 Mini Demo)
- [x] 分布式系统基础主题(故障模型、CAP/PACELC、一致性谱系、复制/分区/quorum/共识/Raft、分布式事务/锁/幂等、逻辑时钟/向量时钟,含 CPU 可运行 Mini Demo)
- [x] Kubernetes 主题(容器编排底座、调度框架、GPU/Gang 调度)
- [x] 容器运行时主题(K8s 之下的执行层:namespace/cgroup/overlayfs、OCI、containerd/runc、镜像供应链安全、沙箱运行时、惰性拉取)
- [x] Helm 主题(K8s 包管理器:Chart/values/template/Release、Tiller 移除与客户端渲染、三方合并 Patch、OCI、GitOps)
- [x] Operator 主题(CRD + 控制循环、Reconcile 四铁律、controller-runtime 架构、finalizer/owner/status/webhook、KubeRay/Training Operator/GPU Operator 源码对照、纯 Python Mini Demo)
- [x] CNI / CSI 深度主题(K8s 网络与存储插件接口:CNI ADD/DEL、CSI Controller/Node、NetworkPolicy、VolumeAttachment、RWO/ROX/RWX、生产排障、纯 Python Mini Demo)
- [x] GPU 在 Kubernetes 上的调度主题(Device Plugin gRPC 协议、GPU Operator 组件编排、nvidia.com/gpu 资源模型、MIG/MPS/time-slicing、拓扑感知调度、Gang/队列/公平调度、生产排障、纯 Python Mini Demo)
- [x] vLLM 主题(LLM 推理引擎)
- [x] SGLang 主题(LLM Program / RadixAttention / 结构化生成)
- [x] TensorRT-LLM 主题(NVIDIA 编译型 LLM 推理引擎)
- [x] Triton Inference Server 主题(多框架推理服务软件)
- [x] LLM Gateway 主题(访问控制与抽象层)
- [x] RL Post-Training 基础设施主题(GRPO/PPO、Rollout/Train 分离、veRL/OpenRLHF 源码、纯 Python Mini Demo)
- [x] Ray 主题(统一分布式 AI 计算框架)
- [x] KServe 主题(Kubernetes 模型服务平台:InferenceService / ServingRuntime / InferenceGraph)
- [x] Kubeflow 主题(Kubernetes 上的 ML 平台:Notebook / Pipelines / Katib / Training Operator / KServe / Central Dashboard)
- [x] MLflow 主题(开源 ML 生命周期平台:Tracking / Models / Model Registry / 生产部署)
- [x] KubeRay 主题(Ray 官方 Kubernetes Operator:RayCluster / RayJob / RayService / 自动扩缩容 / GCS FT)
- [x] Airflow 主题(工作流编排平台:DAG / Operator / Scheduler / Executor / Metadata DB / Triggerer / XCom / Deferrable Operator)
- [x] Agent Runtime 主题(AI Agent 执行容器)
- [x] Memory 主题(AI Agent 记忆系统)
- [x] Multi-Agent 主题(多 Agent 协作系统)
- [x] Reflection 主题(Agent 自我反思与纠错系统)
- [x] MCP 主题(模型上下文协议)
- [x] Planning 主题(Agent 规划系统)
- [x] Tool Use 主题(Agent 工具调用)
- [x] Agent OS 主题(Agent 运行时操作系统)
- [x] RAG 主题(检索增强生成)
- [x] AI SRE 主题(可观测性、可靠性、AIOps)
- [x] Benchmark + Evaluation 主题(Agent / LLM / RAG 可复现评测框架:trace-based eval、benchmark 数据集、CI 评估门、生产回归检测)
- [x] 安全主题(IAM、Secrets、Zero Trust、合规)
- [x] OpenAI 案例研究(训练/推理基础设施、安全与对齐)
- [x] Anthropic 案例研究(宪法对齐、可解释性、异构算力、prompt caching)
- [x] Meta 案例研究(开放权重、硬件协同设计、双网络织物、SDC 治理、MTIA 自研硅)
- [x] Google 案例研究(TPU 自研硅、3D-torus/OCS、NSDI'24 双路径恢复、GSPMD/Pathways、开放软件栈)
- [ ] 更多主题持续建设中……
如何阅读
- 如果你是新手,建议从 学习路线 开始。
- 如果你想快速了解一个主题,先看 阅读指南。
- 如果你关注当前最热门的 LLM 推理引擎,直接阅读 Kubernetes 详解、Helm 详解、Operator 模式详解、容器运行时详解、CNI / CSI 深度详解、GPU 在 Kubernetes 上的调度详解、vLLM 详解、SGLang 详解、TensorRT-LLM 详解、Triton 详解、LLM Gateway 详解、Ray 详解、KServe 详解、Kubeflow 详解、MLflow 详解、KubeRay 详解、Airflow 详解、Agent Runtime 详解、Memory 详解、Multi-Agent 详解、Reflection 详解、MCP 详解、Planning 详解、Tool Use 详解、Agent OS 详解、RAG 详解、AI SRE 详解、安全详解、Linux 系统与性能调优 或 OpenAI 案例研究、Anthropic 案例研究、Meta 案例研究、Google 案例研究。
贡献
欢迎通过 GitHub 提交 Issue 和 PR。所有内容采用 CC-BY-SA-4.0 协议授权。
License
CC-BY-SA-4.0