Skip to content

11. 延伸阅读

一句话理解

RL Post-Training 是一个跨学科的领域——强化学习理论、分布式系统、推理引擎、训练框架缺一不可。以下资源按"论文 → 框架 → 系统 → 实践"分类,帮你从原理到落地建立完整认知。

一、经典论文

RLHF 奠基

PPO 与算法

推理能力训练

推理引擎

  • Efficient Memory Management for Large Language Model Serving with PagedAttention(vLLM, SOSP 2023)

  • SGLang: Efficient Execution of Structured Language Model Programs(SGLang, 2024)

二、开源框架

主力框架

各家自研

推理引擎

三、关键系统与基础设施

沙箱与环境

调度与编排

训练框架

四、博客与技术报告

OpenAI

DeepSeek

Anthropic

字节 Seed

阿里 Qwen

技术博客

五、课程与书籍

六、相关主题

本手册中的其他主题与 RL Post-Training 深度相关:

一句话总结

从 InstructGPT 到 R1,RL Post-Training 用了三年从"对齐技巧"成长为"能力引擎"。理解它需要论文 + 框架 + 系统三重视角——希望这份清单能帮你在自己的场景中复现并超越这些工作。

Released under CC-BY-SA-4.0 License.