Skip to content

Repository files navigation

LLM 从基础到前沿 — Part III: 对齐与后训练

Python

简介

LLM 对齐与后训练专题,从 SFT 到 Superalignment。Part III = 16 章,独立可运行 Python 文件 + 中文注释。

80 章 5 Parts:

快速开始

python3 Hello.py
python3 33_sft/sft.py
python3 38_dpo/dpo.py
python3 43_peft_lora/peft_lora.py

Part III 核心速查

章节 主题 核心概念
33 SFT 监督微调, Loss Masking, LIMA(1000条够用)
34 SFT 数据 Self-Instruct, Evol-Instruct, 质量>>数量
35 RLHF 概览 三阶段(SFT→RM→PPO), 偏好>评分
36 奖励模型 Bradley-Terry Loss, 奖励Hacking, 多维度RM
37 PPO KL约束, Clip机制, GAE优势估计, 4模型同跑
38 DPO 闭式解, 跳过RM+PPO, 对齐的事实标准
39 DPO 变体 IPO(降噪), KTO(非成对), ORPO(一步到位), SimPO(去Ref)
40 Constitutional AI AI宪法, RLAIF(AI替代人类), 规则vs数据
41 安全与红队 越狱分类, 安全训练, HHH原则, 多语言安全
42 评估体系 MMLU, HumanEval, Chatbot Arena(Elo), LLM-as-Judge
43 PEFT & LoRA 低秩适配, QLoRA(10GB微调7B), 可合并推理
44 Full vs PEFT 灾难性遗忘, 多Adapter切换, 微调决策树
45 偏好数据 收集策略, 多维度偏好, 位置/长度/风格偏见
46 对齐税 能力退化, 模式坍塌, Pareto平衡, Superalignment
47 RLHF 替代 Rejection Sampling, Best-of-N, RRHF, SPIN
48 对齐未来 弱到强泛化, 形式化对齐, 参与式对齐, 展望

设计原则

  • Python 3.8+: NumPy 数值模拟,纯 Python 可运行
  • 独立可运行: 每章一个 .py 文件
  • 中文注释: 关键概念中文详解
  • 内嵌演示: 每个文件内置 main()

参考资料

  • InstructGPT (Ouyang et al., 2022)
  • LLaMA-2 (Touvron et al., 2023)
  • DPO (Rafailov et al., 2023)
  • Constitutional AI (Bai et al., 2022)
  • LoRA (Hu et al., 2021)
  • QLoRA (Dettmers et al., 2023)

许可

MIT License

About

THU大语言模型 Part III: 对齐与后训练 | SFT/RLHF/DPO/ConstitutionalAI/安全红队/评估/LoRA/偏好数据/对齐税/Superalignment | 16章Python+NumPy

Resources

Stars

1 star

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages