LLM 训练与推理专题,从 GPT 家族演进到硬件生态。Part II = 16 章,每章一个独立可运行的 Python 文件 + 中文注释。
对应的 GitHub 仓库(5 Parts 独立仓库):
- LLMBasic — Part I: 基础与架构 (01-16)
- LLMTrainingAndInference — Part II: 训练与推理 (17-32)
- LLMAlignment — Part III: 对齐与后训练 (33-48)
- LLMAdvance — Part IV: 高级能力 (49-64)
- LLMFrontier — Part V: 前沿与应用 (65-80)
llm_training/
├── Hello.py # 入口
├── 17_gpt_evolution/ GPT家族演进 (GPT-1→4→o1/o3)
├── 18_llama_ecosystem/ LLaMA与开源生态
├── 19_training_data/ 训练数据工程
├── 20_pretraining_pipeline/ 预训练实战流程
├── 21_mixed_precision/ 混合精度训练
├── 22_memory_optimization/ 显存优化技术
├── 23_optimizers_deep/ 优化器深度解析
├── 24_lr_scheduling/ 学习率调度策略
├── 25_decoding_strategies/ 自回归解码策略
├── 26_kv_cache/ KV Cache原理
├── 27_paged_attention/ PagedAttention & vLLM
├── 28_quantization/ 模型量化
├── 29_flash_attention/ Flash Attention
├── 30_speculative_decoding/ Speculative Decoding
├── 31_serving_systems/ 推理服务系统
└── 32_hardware_ecosystem/ 硬件生态
python3 Hello.py
python3 17_gpt_evolution/gpt_evolution.py
python3 25_decoding_strategies/decoding_strategies.py
python3 29_flash_attention/flash_attention.py
python3 30_speculative_decoding/speculative_decoding.py| 章节 | 主题 | 核心概念 |
|---|---|---|
| 17 | GPT 家族 | GPT-1(117M)→GPT-3(In-Context)→GPT-4(MoE)→o1(推理时计算) |
| 18 | 开源生态 | LLaMA-1/2/3, Mistral, Qwen, DeepSeek, Gemma |
| 19 | 训练数据 | 收集/清洗/去重(MinHash)/配比/退火 |
| 20 | 预训练 | CLM Loss, 训练循环, 梯度累积, 监控 |
| 21 | 混合精度 | FP16/BF16/FP8, Loss Scaling |
| 22 | 显存优化 | Gradient Checkpointing, Offloading, Micro-Batching |
| 23 | 优化器 | SGD→Adam→AdamW, 解耦权重衰减 |
| 24 | 学习率 | Warmup, Cosine Decay, Restarts |
| 25 | 解码策略 | Greedy, Beam, Top-k, Top-p, Temperature |
| 26 | KV Cache | 缓存机制, GQA/MQA, 长序列瓶颈 |
| 27 | PagedAttention | 分页KV, Continuous Batching, vLLM (24×吞吐) |
| 28 | 量化 | GPTQ, AWQ, GGUF (Q4_K_M推荐) |
| 29 | Flash Attention | IO-Aware, 在线Softmax, O(N)显存, FA1/2/3 |
| 30 | 投机解码 | Draft+Verify, 无损加速2-3×, Medusa/EAGLE |
| 31 | 推理服务 | vLLM, SGLang, TGI, OpenAI兼容API |
| 32 | 硬件 | V100→A100→H100→B200, TPU, Apple Silicon |
- Python 3.8+: 标准科学计算栈 (NumPy)
- 独立可运行: 每章一个
.py文件 - 中文注释: 关键概念用中文详解
- 内嵌演示: 不用 Jupyter,每个文件内置 main()
- GPT-3 (Brown et al., 2020)
- LLaMA & LLaMA-2 (Touvron et al., 2023)
- Chinchilla (Hoffmann et al., 2022)
- Flash Attention (Dao et al., 2022/2023)
- PagedAttention / vLLM (Kwon et al., 2023)
- GPTQ (Frantar et al., 2023)
- Speculative Decoding (Leviathan et al., 2023)
本仓库由 AI 协作完成:
- 代码架构与实现: Claude (Anthropic)
- 推理引擎: DeepSeek V4 Pro (1M 上下文)
MIT License