Skip to content

Latest commit

 

History

1 Commit

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

LLM 从基础到前沿 — Part II: 训练与推理

Python NumPy

简介

LLM 训练与推理专题,从 GPT 家族演进到硬件生态。Part II = 16 章,每章一个独立可运行的 Python 文件 + 中文注释。

对应的 GitHub 仓库(5 Parts 独立仓库):

仓库结构

llm_training/
├── Hello.py                                    # 入口
├── 17_gpt_evolution/           GPT家族演进 (GPT-1→4→o1/o3)
├── 18_llama_ecosystem/         LLaMA与开源生态
├── 19_training_data/           训练数据工程
├── 20_pretraining_pipeline/    预训练实战流程
├── 21_mixed_precision/         混合精度训练
├── 22_memory_optimization/     显存优化技术
├── 23_optimizers_deep/         优化器深度解析
├── 24_lr_scheduling/           学习率调度策略
├── 25_decoding_strategies/     自回归解码策略
├── 26_kv_cache/                KV Cache原理
├── 27_paged_attention/         PagedAttention & vLLM
├── 28_quantization/            模型量化
├── 29_flash_attention/         Flash Attention
├── 30_speculative_decoding/    Speculative Decoding
├── 31_serving_systems/         推理服务系统
└── 32_hardware_ecosystem/      硬件生态

快速开始

python3 Hello.py
python3 17_gpt_evolution/gpt_evolution.py
python3 25_decoding_strategies/decoding_strategies.py
python3 29_flash_attention/flash_attention.py
python3 30_speculative_decoding/speculative_decoding.py

Part II 核心速查

章节 主题 核心概念
17 GPT 家族 GPT-1(117M)→GPT-3(In-Context)→GPT-4(MoE)→o1(推理时计算)
18 开源生态 LLaMA-1/2/3, Mistral, Qwen, DeepSeek, Gemma
19 训练数据 收集/清洗/去重(MinHash)/配比/退火
20 预训练 CLM Loss, 训练循环, 梯度累积, 监控
21 混合精度 FP16/BF16/FP8, Loss Scaling
22 显存优化 Gradient Checkpointing, Offloading, Micro-Batching
23 优化器 SGD→Adam→AdamW, 解耦权重衰减
24 学习率 Warmup, Cosine Decay, Restarts
25 解码策略 Greedy, Beam, Top-k, Top-p, Temperature
26 KV Cache 缓存机制, GQA/MQA, 长序列瓶颈
27 PagedAttention 分页KV, Continuous Batching, vLLM (24×吞吐)
28 量化 GPTQ, AWQ, GGUF (Q4_K_M推荐)
29 Flash Attention IO-Aware, 在线Softmax, O(N)显存, FA1/2/3
30 投机解码 Draft+Verify, 无损加速2-3×, Medusa/EAGLE
31 推理服务 vLLM, SGLang, TGI, OpenAI兼容API
32 硬件 V100→A100→H100→B200, TPU, Apple Silicon

设计原则

  • Python 3.8+: 标准科学计算栈 (NumPy)
  • 独立可运行: 每章一个 .py 文件
  • 中文注释: 关键概念用中文详解
  • 内嵌演示: 不用 Jupyter,每个文件内置 main()

参考资料

  • GPT-3 (Brown et al., 2020)
  • LLaMA & LLaMA-2 (Touvron et al., 2023)
  • Chinchilla (Hoffmann et al., 2022)
  • Flash Attention (Dao et al., 2022/2023)
  • PagedAttention / vLLM (Kwon et al., 2023)
  • GPTQ (Frantar et al., 2023)
  • Speculative Decoding (Leviathan et al., 2023)

构建说明

本仓库由 AI 协作完成:

  • 代码架构与实现: Claude (Anthropic)
  • 推理引擎: DeepSeek V4 Pro (1M 上下文)

许可

MIT License

About

THU大语言模型 Part II: 训练与推理 | GPT演进/LLaMA生态/训练数据/混合精度/显存优化/量化/KV Cache/FlashAttention/投机解码/vLLM | 16章Python+NumPy

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages