LLM 对齐与后训练专题,从 SFT 到 Superalignment。Part III = 16 章,独立可运行 Python 文件 + 中文注释。
80 章 5 Parts:
- LLMBasic — Part I: 基础与架构
- LLMTrainingAndInference — Part II: 训练与推理
- LLMAlignment — Part III: 对齐与后训练
- LLMAdvance — Part IV: 高级能力
- LLMFrontier — Part V: 前沿与应用
python3 Hello.py
python3 33_sft/sft.py
python3 38_dpo/dpo.py
python3 43_peft_lora/peft_lora.py| 章节 | 主题 | 核心概念 |
|---|---|---|
| 33 | SFT | 监督微调, Loss Masking, LIMA(1000条够用) |
| 34 | SFT 数据 | Self-Instruct, Evol-Instruct, 质量>>数量 |
| 35 | RLHF 概览 | 三阶段(SFT→RM→PPO), 偏好>评分 |
| 36 | 奖励模型 | Bradley-Terry Loss, 奖励Hacking, 多维度RM |
| 37 | PPO | KL约束, Clip机制, GAE优势估计, 4模型同跑 |
| 38 | DPO | 闭式解, 跳过RM+PPO, 对齐的事实标准 |
| 39 | DPO 变体 | IPO(降噪), KTO(非成对), ORPO(一步到位), SimPO(去Ref) |
| 40 | Constitutional AI | AI宪法, RLAIF(AI替代人类), 规则vs数据 |
| 41 | 安全与红队 | 越狱分类, 安全训练, HHH原则, 多语言安全 |
| 42 | 评估体系 | MMLU, HumanEval, Chatbot Arena(Elo), LLM-as-Judge |
| 43 | PEFT & LoRA | 低秩适配, QLoRA(10GB微调7B), 可合并推理 |
| 44 | Full vs PEFT | 灾难性遗忘, 多Adapter切换, 微调决策树 |
| 45 | 偏好数据 | 收集策略, 多维度偏好, 位置/长度/风格偏见 |
| 46 | 对齐税 | 能力退化, 模式坍塌, Pareto平衡, Superalignment |
| 47 | RLHF 替代 | Rejection Sampling, Best-of-N, RRHF, SPIN |
| 48 | 对齐未来 | 弱到强泛化, 形式化对齐, 参与式对齐, 展望 |
- Python 3.8+: NumPy 数值模拟,纯 Python 可运行
- 独立可运行: 每章一个
.py文件 - 中文注释: 关键概念中文详解
- 内嵌演示: 每个文件内置 main()
- InstructGPT (Ouyang et al., 2022)
- LLaMA-2 (Touvron et al., 2023)
- DPO (Rafailov et al., 2023)
- Constitutional AI (Bai et al., 2022)
- LoRA (Hu et al., 2021)
- QLoRA (Dettmers et al., 2023)
MIT License