Skip to content

延伸阅读

本章汇总 Anthropic 相关的权威来源、官方文档、论文、可解释性研究与本手册交叉引用。

官方来源

论文与可解释性研究

  • Bai et al. 2022Constitutional AI: Harmlessness from AI FeedbackarXiv:2212.08073)— CAI / RLAIF 奠基论文。
  • Elhage et al. 2021A Mathematical Framework for Transformer Circuitstransformer-circuits.pub)— attention heads、induction heads。
  • Bricken et al. 2023Towards Monosemanticity — dictionary learning / 稀疏自编码器分解特征。
  • Templeton et al. 2024Scaling Monosemanticity — 在 Claude 3 Sonnet 上解析数百万特征。
  • Anthropic 2025On the Biology of a Large Language Model / Circuit Tracing — 特征作为分类器、电路级追踪。

算力与合作

开源与生态

工程分析

本手册交叉引用

  • OpenAI 案例研究 — 对照"规模驱动" vs "对齐驱动"两条路线。
  • Meta 案例研究 — 对照"闭源对齐(Anthropic)↔ 开放权重 + 硬件协同设计(Meta)";Meta 也公开 SDC 治理与 >95% 有效训练时间的可靠性工程。
  • Google 案例研究 — 对照"闭源对齐"与"开放生态 + Frontier Safety Framework";两者都有正式的安全治理框架,Google 另开放完整软件栈。
  • vLLM 详解 — continuous batching、KV/prefix cache 工程化。
  • LLM Gateway 详解 — 多云入口、限流、计费、cache 感知路由。
  • Agent Runtime 详解 — tool/computer use、extended thinking 的执行循环。
  • MCP 详解 — Anthropic 主导的工具/资源协议。
  • 安全详解 — RSP/ASL、guardrails、红队、权重安全。
  • AI SRE 详解 — 容量规划、cache 命中率、成本 SLO。

学习路径建议

  1. 先读 Constitutional AI 论文,理解 CAI/RLAIF 与 RLHF 的区别。
  2. 读 RSP v3 与 Claude's Constitution,理解治理化扩展的思想。
  3. 精读 Prompt Caching 官方文档,跑通本主题 Mini Demo 的命中模型。
  4. 浏览 transformer-circuits.pub 的 Towards/Scaling Monosemanticity,理解可解释性工程化。
  5. 结合 OpenAI 案例研究 做对照阅读,形成完整的"前沿实验室工程路线"地图。

小结

Anthropic 的公开资料在"对齐、可解释性、治理"三条线上是行业最系统的。建议持续关注 Anthropic News、transformer-circuits、Claude Platform Docs 与 RSP/Risk Report 的更新——这三条线仍在快速演进。

Released under CC-BY-SA-4.0 License.