不讲玄学,只读代码。每一篇都基于真实开源项目的源码逐行拆解,把算法原理、数学公式、 模型架构、工程实现讲到你能自己复述出来为止。
这是两个独立的博客系列,可以分开读,也可以按"先图像、后语言"的顺序连起来读。
面向完全不懂扩散模型的人。 从"一句话凭什么能变成一张图"开始,用比喻和直觉一步步建立对 扩散 / Flow Matching / DiT / VAE / CFG 的理解,最后落到开源模型 Ideogram 4 的真实代码。
- 📕 9 篇正文 + 1 篇技术报告存档
- 🎯 风格:直觉优先、少公式、多比喻
- ⏱️ 全系列约 70 分钟
- 👉 进入系列首页 →
| # | 博客标题 | 一句话 |
|---|---|---|
| 1 | 文生图到底是个什么问题 | 为什么"一句话生成图"这么难 |
| 2 | 扩散模型直觉:加噪与去噪 | 生成=把噪声一点点擦成图 |
| 3 | Flow Matching:更简洁的"流" | Ideogram 用的训练方式 |
| 4 | 文本编码器:让模型读懂你的话 | 为什么用 Qwen3-VL |
| 5 | 单流 DiT:模型的大脑 | 文字和图像塞进同一个网络 |
| 6 | 采样与 CFG:噪声怎么变成图 | 去噪循环 + 如何"听话" |
| 7 | VAE 与隐空间:图像的压缩包 | 为什么不直接生成像素 |
| 8 | JSON Prompt:Ideogram 的杀手锏 | 结构化提示词的精确控制 |
| 9 | 代码导读:概念落到文件 | 把概念对应到每个 .py |
面向想真正搞懂 LLM 实现的人。 逐行拆解 Karpathy 的 nanoGPT, 不回避数学公式与工程细节,从语言模型基础一路讲到混合精度、DDP、Flash Attention、Scaling Laws。
- 📗 10 篇正文
- 🎯 风格:严谨、含数学推导、对照源码
- ⏱️ 全系列约 110 分钟
- 👉 进入系列首页 →
| # | 博客标题 | 关键公式 / 工程点 |
|---|---|---|
| 1 | 语言模型与 GPT 基础 | P(x)=∏P(xₜ|x_<ₜ)、交叉熵 |
| 2 | 数据与分词 | BPE、memmap、get_batch |
| 3 | 嵌入层与序列表示 | weight tying |
| 4 | 自注意力机制(数学核心) | softmax(QKᵀ/√dₖ)V |
| 5 | 多头与 Flash Attention | IO-aware 注意力 |
| 6 | Block:归一化·残差·MLP | Pre-LN、std=0.02/√(2L) |
| 7 | 完整 GPT 架构与损失 | 参数量推导出 124M |
| 8 | 优化:AdamW 与学习率 | Adam 更新式、余弦退火 |
| 9 | 训练系统工程 | 混合精度、梯度累积、DDP |
| 10 | 推理生成与规模算力 | 6N+12LHQT、MFU、Scaling |
- 怎么读:每篇开头有目录和阅读时长,结尾有"上一篇/下一篇"导航,可以像翻书一样连读,也可以按目录跳到任意小节。
- 代码链接:正文里的
代码引用都链接到上游开源仓库对应文件,点开即可对照原始实现。 - 公式显示:关键公式写在代码块里(ASCII 形式),在 GitHub、Typora、各大博客平台都能正常显示,不依赖 LaTeX 渲染。
- 版权:课程为个人学习整理,所涉代码与文档版权归各开源项目所有。欢迎转载,请注明来源。
想直接开读?从 🎨 文生图系列第 1 篇 或 🤖 nanoGPT 系列第 1 篇 开始。