Skip to content

11. 延伸阅读

官方文档(必读)

开源项目

商业/托管方案

相关主题

  • Agent Runtime 详解 — Agent 的执行容器,常与 LLM Gateway 组合使用以统一接入多模型。
  • vLLM 详解 — LLM 推理引擎,可作为 Gateway 上游。
  • SGLang 详解 — LLM Program 执行引擎,可作为 Gateway 上游。
  • TensorRT-LLM 详解 — NVIDIA 编译型推理引擎,可作为 Gateway 上游。
  • Triton Inference Server 详解 — 多框架推理服务入口,常与 Gateway 配合使用。
  • KServe 详解 — Kubernetes 模型服务平台,可为 Gateway 提供集群内模型端点、扩缩与金丝雀能力。
  • Ray 详解 — Ray Serve 可作为 Gateway 上游的分布式推理引擎,Ray Serve LLM 提供 OpenAI-compatible 端点。

推荐学习路径

  1. 先通读 OpenAI API Reference,理解请求/响应格式。
  2. 本地用 LiteLLM Proxy 接入 OpenAI 与 vLLM,跑通 /chat/completions
  3. 阅读 LiteLLM router.pyproxy_server.py,理解路由与限流实现。
  4. 学习 Envoy AI Gateway 的 filter 链与 Gateway API 集成。
  5. 用本主题的 Mini Demo 手动扩展一个自定义 provider 或路由策略。
  6. 在生产环境中从独立 LiteLLM Proxy 开始,逐步引入 Redis、Vault、Prometheus。

本章小结

LLM Gateway 的生态系统正在快速演进。OpenAI API 已成为事实标准,LiteLLM 是最易落地的开源方案,Envoy/Kong 适合与现有基础设施深度集成,Cloudflare 等托管方案则适合希望零运维的团队。结合本主题的 Mini Demo生产实践最佳实践,可以从理论到工程全面掌握 LLM Gateway。

参考来源

Released under CC-BY-SA-4.0 License.