11. 延伸阅读
一句话理解
RL Post-Training 是一个跨学科的领域——强化学习理论、分布式系统、推理引擎、训练框架缺一不可。以下资源按"论文 → 框架 → 系统 → 实践"分类,帮你从原理到落地建立完整认知。
一、经典论文
RLHF 奠基
Training language models to follow instructions with human feedback(OpenAI, 2022)
- InstructGPT 论文,RLHF 的开山之作。
- https://arxiv.org/abs/2203.02155
Constitutional AI: Harmlessness from AI Feedback(Anthropic, 2022)
- RLAIF 的代表作,用 AI 反馈代替人类反馈。
- https://arxiv.org/abs/2212.08073
PPO 与算法
Proximal Policy Optimization Algorithms(OpenAI, 2017)
- PPO 原始论文。
- https://arxiv.org/abs/1707.06347
Direct Preference Optimization(Stanford, 2023)
- DPO 原始论文,把 RL 转化为监督学习。
- https://arxiv.org/abs/2305.18290
推理能力训练
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning(DeepSeek, 2025)
- 纯 RL 涌现推理能力的代表作,GRPO 的工程实践。
- https://arxiv.org/abs/2501.12948
Qwen3 Technical Report(Alibaba, 2025)
- GSPO 算法 + Agentic RL 工程实践。
- https://arxiv.org/abs/2505.09388
Kimi K2: Open Agentic Intelligence(Moonshot, 2025)
- 大规模 Agentic RL 的代表。
- https://arxiv.org/abs/2507.20534
推理引擎
Efficient Memory Management for Large Language Model Serving with PagedAttention(vLLM, SOSP 2023)
- vLLM 的 PagedAttention 论文,RL Rollout 的引擎基础。
- https://arxiv.org/abs/2309.06180
SGLang: Efficient Execution of Structured Language Model Programs(SGLang, 2024)
- RadixAttention,多轮 Rollout 的关键优化。
- https://arxiv.org/abs/2312.07104
二、开源框架
主力框架
veRL(字节 Seed)
- 生产级 RL 训练框架,HybridEngine 同卡时分复用。
- https://github.com/volcengine/verl
OpenRLHF
- 社区最活跃的 RLHF 框架,Ray + vLLM + DeepSpeed。
- https://github.com/OpenRLHF/OpenRLHF
NeMo-RL(NVIDIA)
- NVIDIA 官方 RL 框架,深度整合 TensorRT-LLM。
- https://github.com/NVIDIA/NeMo-RL
TRL(HuggingFace)
- 教学与小规模实验首选。
- https://github.com/huggingface/trl
各家自研
AReaL(蚂蚁)
- 大规模异步 RL 训练。
- https://github.com/inclusionAI/AReaL
slime(清华 / 智谱)
- GLM 系列的 RL 训练框架。
- https://github.com/THUDM/slime
ROLL(阿里)
- Agentic RL 专用。
- https://github.com/alibaba/ROLL
推理引擎
vLLM
SGLang
TensorRT-LLM
三、关键系统与基础设施
沙箱与环境
e2b:Agent 沙箱即服务
Firecracker:AWS 开源的 microVM
gVisor:Google 用户态内核
调度与编排
Ray:分布式 Python 框架,veRL / OpenRLHF 的底座
Kubernetes:容器编排底座
训练框架
Megatron-LM:NVIDIA 大规模训练框架
DeepSpeed:Microsoft 大规模训练框架
PyTorch FSDP:PyTorch 原生分布式
四、博客与技术报告
OpenAI
- Learning to Reason with LLMs(o1 发布博客)
DeepSeek
- DeepSeek-R1 发布博客
Anthropic
- Claude's Character(Constitutional AI 应用)
字节 Seed
- Seed-Thinking-v1.5(RL 训练实践)
阿里 Qwen
- Qwen3 技术博客
技术博客
Chip Huyen: RLHF
Lilian Weng: LLM Powered Autonomous Agents
HuggingFace: RLHF 详解
五、课程与书籍
Deep RL Course(HuggingFace)
Spinning Up in Deep RL(OpenAI)
Reinforcement Learning: An Introduction(Sutton & Barto)
- RL 经典教材,第 2 版。
- http://incompleteideas.net/book/the-book-2nd.html
六、相关主题
本手册中的其他主题与 RL Post-Training 深度相关:
- 大模型从 0 到 1:预训练与后训练的全景
- vLLM 详解:RL Rollout 的核心引擎
- SGLang 详解:多轮 Rollout 的优化引擎
- Ray 详解:RL 分布式调度底座
- Kubernetes 详解:RL 集群调度
- GPU 在 Kubernetes 上的调度:Rollout/Train 混合负载调度
- Agent Runtime 详解:Agentic RL 的环境侧
- Agent OS 详解:Agentic RL 的沙箱底座
- AI SRE 详解:RL 训练的可观测性
- Benchmark + Evaluation:RL 效果评估
一句话总结
从 InstructGPT 到 R1,RL Post-Training 用了三年从"对齐技巧"成长为"能力引擎"。理解它需要论文 + 框架 + 系统三重视角——希望这份清单能帮你在自己的场景中复现并超越这些工作。