🎯 AI Infra 转行准备 · 3 个月学习路线图 · 全部仓库深度分析 · 面试准备
🔬 Focus: CUDA Kernels · LLM Inference · GPU Computing · ML Compilers
📅 Timeline: 12 Weeks · 20-25h/week
📚 Repos Analyzed: 21 Fork Repos with Deep-Dive Guides
全部 29 个 GitHub 仓库的分类索引 — 按 AI Infra 相关性分为核心、辅助、HPC、个人项目、工具等类别。
每个 Fork 仓库都有独立的深度分析文件(架构、精髓、学习路径、面试考点)。
|
NVIDIA 官方 CUDA 示例 · 从入门到高级的 CUDA 特性演示 |
Triton 语言与编译器 · OpenAI 开源的 GPU Kernel 编程语言 |
|
Apache TVM · 端到端 ML 编译器框架 |
Flash Attention 官方实现 · 高效精确注意力机制 |
|
高吞吐 LLM 推理引擎 · PagedAttention 开创者 |
高性能 LLM 服务框架 · RadixAttention 前缀缓存 |
|
NVIDIA TensorRT LLM · 工业级推理优化(含 25 篇中文文档) |
|
从零实现 CUDA 矩阵乘法 · 6 层优化逐步讲解 |
LLM 推理 Kernel 库 · Attention/Sampling/量化 |
|
PyTorch C++/CUDA 扩展教程 · 自定义算子 |
轻量级 LLM 推理框架 · 与 vLLM 对比学习 |
|
GPU Mode 讲座材料 · 系统性 GPU 编程学习 |
通过谜题学习 Triton 编程 · 15 个互动练习 |
|
CUDA 课程 · 系统学习 CUDA 编程 |
SGLang 精简版 · 快速理解推理引擎核心 |
|
Nano vLLM · 最小化推理引擎实现 |
最小 GPT 实现 · Karpathy 经典教学代码 |
|
LLM 开发实战 · 从数据处理到推理部署 |
Triton 推理服务器教程 · 模型部署 |
|
深度学习课程笔记 · 补充 DL 基础知识 |
|
C++20 性能工程指南 · 个人原创 |
|
|
C++23 位运算练习库 · SIMD 加速 · 个人原创 |
|
Personal Project Hub · AI Infra & HPC |
多机开发环境配置模板源 |
|
Cursor AI 编程规则精选集 |
TensorTonic 题解 |
|
个人博客 |
Termius 汉化 |
📇 完整索引(字母顺序) · 📚 建议阅读顺序
目标:具备 AI Infra 工程师的面试能力 — 熟练编写 CUDA/Triton Kernel,理解 LLM 推理引擎架构,掌握 ML 编译器原理,有 1-2 个可展示项目。
| 阶段 | 时间 | 主题 | 对应仓库 |
|---|---|---|---|
| 阶段一 | 第 1-4 周 | CUDA 基础 → PyTorch 内部 → GPU 性能优化 → Flash Attention | cuda-samples · SGEMM_CUDA · extension-cpp · flash-attention |
| 阶段二 | 第 5-8 周 | LLM 推理引擎 → TensorRT-LLM → Triton → TVM | vllm · sglang · TensorRT-LLM · triton · tvm |
| 阶段三 | 第 9-12 周 | FlashInfer → 个人项目 → 系统设计 → 面试冲刺 | flashinfer · 个人项目 · 复习 |
21 个 Fork 仓库的深度学习指南 — 每个文件包含:架构分析、精髓提炼、学习路径(按天)、面试考点、动手练习。
| 优先级 | 仓库 | 深度分析 | 关键内容 |
|---|---|---|---|
| ⭐⭐⭐⭐⭐ | cuda-samples | deep-dive | CUDA 编程模型、4 级示例分类、14 天学习路径 |
| ⭐⭐⭐⭐⭐ | triton | deep-dive | Block-based 编程、编译器优化、6 个官方教程 |
| ⭐⭐⭐⭐⭐ | flash-attention | deep-dive | 3 层理解、Online Softmax 推导、Triton 实现 |
| ⭐⭐⭐⭐⭐ | vllm | deep-dive | PagedAttention、Continuous Batching、调度器 |
| ⭐⭐⭐⭐⭐ | sglang | deep-dive | RadixAttention、调度策略、结构化生成 |
| ⭐⭐⭐⭐ | tvm | deep-dive | 4 层抽象、调度原语、自动调优 |
| ⭐⭐⭐⭐ | TensorRT-LLM | deep-dive | 图优化、IFB、量化、并行、分离式服务 |
| ⭐⭐⭐⭐ | SGEMM_CUDA | deep-dive | GEMM 优化 6 层次 |
| ⭐⭐⭐⭐ | flashinfer | deep-dive | 4 类 Kernel 实现 |
| ⭐⭐⭐⭐ | extension-cpp | deep-dive | PyTorch C++/CUDA 扩展 |
| ⭐⭐⭐⭐ | lectures | deep-dive | GPU Mode 讲座体系 |
| ⭐⭐⭐⭐ | Triton-Puzzles | deep-dive | 15 个互动 Puzzle |
| ⭐⭐⭐ | LightLLM | deep-dive | 与 vLLM 对比 |
| ⭐⭐⭐ | cuda-course | deep-dive | CUDA 系统课程 |
| ⭐⭐⭐ | mini-sglang | deep-dive | SGLang 精简版 |
| ⭐⭐⭐ | nano-vllm | deep-dive | vLLM 精简版 |
| ⭐⭐ | minGPT | deep-dive | GPT 最小实现 |
| ⭐⭐ | LLM-Workshop | deep-dive | LLM 开发实战 |
| ⭐⭐ | tutorials | deep-dive | Triton 推理服务器 |
| ⭐⭐ | dataflowr-notebooks | deep-dive | DL 课程笔记 |
| ⭐⭐ | ompi | deep-dive | MPI 分布式通信 |
📂 全部深度分析目录
|
|
| 第 1 周 CUDA 编程基础 |
第 2 周 PyTorch 内部机制 |
第 3 周 GPU 性能优化 |
第 4 周 Flash Attention |
| 第 5 周 LLM 推理引擎 |
第 6 周 TensorRT-LLM |
第 7 周 Triton 语言 |
第 8 周 ML 编译器 |
| 第 9 周 FlashInfer |
第 10 周 个人项目 |
第 11 周 系统设计 |
第 12 周 查漏补缺 |
ai-infra-interview-prep/
├── README.md # 👈 本文件(导航 + 路线图)
├── ROADMAP.md # 3 个月学习路线图
├── study-plan.md # 详细学习计划与时间分配
├── knowledge-map.md # AI Infra 知识图谱
├── resources.md # 资源汇总(仓库 + 外部资源)
├── interview-prep.md # 面试准备(常见问题 + 权重)
├── progress-tracker.md # 进度追踪表
├── repo-index.md # 全部仓库索引(字母顺序)
├── learning-path.md # 建议阅读顺序
├── deep-dives/ # 🔬 21 个仓库的深度分析
│ ├── README.md # 深度分析目录索引
│ ├── cuda-samples.md # CUDA 示例深度分析
│ ├── triton.md # Triton 深度分析
│ ├── vllm.md # vLLM 深度分析
│ └── ... # 共 21 个文件
├── weekly/ # 📅 12 周详细学习计划
│ ├── week-01.md ~ week-12.md
├── projects/ # 💡 项目想法与规划
│ ├── project-ideas.md
│ └── personal-projects.md
└── notes/ # 学习笔记