Skip to content

JustQJ/LLM-Technique-Notes

Repository files navigation

LLM Technique Notes

这个仓库用于整理大模型推理、长上下文注意力机制和 DSA 相关工程优化笔记。

文档目录

梳理 sparse attention / long-context attention 的四类结构,并重点说明 attention 数据流、张量 shape 变化、mask 或 sparse index 如何约束 token 可见性。

主要内容:

  • 基础 DSA:介绍 DeepSeek-V3.2、GLM-5、GLM-5.1 中 MLA、Lightning Indexer 与 Sparse Attention 的主链路。
  • GLM-5.2 DSA:说明 IndexShare / idxcache 如何在多层之间复用 top-k indices,降低 indexer 开销。
  • DeepSeek V4 Attention:整理 sliding window KV、HCA/CSA compressed KV 和对应 mask 结构。
  • MiniMax Sparse Attention:整理 GQA group 粒度的 blockwise sparse attention、block max-pooling score 和常见 block 配置。
  • 对比总结:对 dense attention、基础 DSA、GLM-5.2 DSA、DeepSeek V4 attention 和 MiniMax MSA 的可见性与工程差异做横向比较。

整理常见整数、浮点和低精度 AI 数值格式的 bit layout、数值范围、典型用途和主要取舍。

主要内容:

  • 整数格式:介绍 int32uint32int16uint16int8uint8 的范围和 signed / unsigned 差异。
  • 常规浮点:介绍 float32float16bf16 的 layout、动态范围、精度和训练/推理用途。
  • FP8 / FP6 / FP4:整理 E5M2E4M3E2M3E3M2E2M1、Ascend HiF8、Ascend HiF4 的字段划分、范围和典型用途。
  • Block-scaled formats:介绍 MXFP8MXFP6MXFP4NVFP4HiF4 的 shared scale、block size 和存储开销。

系统整理大语言模型量化的工程原理与实际推理路径,重点区分模型容量、访存带宽、算子计算和端到端性能收益。

主要内容:

  • LLM 量化的动机,以及权重、激活和 KV Cache 的资源瓶颈。
  • 常见低精度格式、量化参数、粒度、对称性与静态/动态量化。
  • Weight-only、W8A8、W4A8、W4A4 和 KV Cache 量化的计算路径。
  • GPTQ、AWQ、SmoothQuant 等常见算法的目标与取舍。
  • 量化工具链、硬件算子支持,以及容量收益与真实加速的区别。

围绕 DSA indexer 的性能瓶颈,整理现有论文方法、优化轴和可落地的工程路线,重点关注如何减少 indexer score computation、降低 top-k selector 开销以及在速度和精度之间取舍。

主要内容:

  • 背景分析:解释为什么 DSA 的主 attention 已经稀疏化后,indexer 仍可能成为长上下文推理瓶颈。
  • 论文方法:总结 IndexCache、HISA、MISA、TISA、GVR Top-K 等方法的核心思路、收益和风险。
  • 方法对比:按 layer、token/block、head、decode time、top-k selector 等优化轴进行对照。
  • 进一步优化:提出 Top-M IndexCache、Full/Rerank/Reuse 三类层策略、距离自适应 top-m、IndexCache + TISA、Cross-layer GVR 等组合方案。
  • 工程路线:给出从 profile、基础 IndexCache、Top-M IndexCache 到 TISA-lite 和 GVR 的分阶段落地建议。

说明 Split-KV Attention 为什么能在保持数学等价的前提下并行处理多个 KV 分片,以及分片内 Online Softmax 和分片间 LSE Reduce 的统一原理。

主要内容:

  • Split-KV 的分区可加性与全局 attention 重建公式。
  • Online Softmax 的 (m, l, acc) 状态及稳定合并方法。
  • LSE = m + log(l) 的来源与局部 softmax 总质量的含义。
  • 使用 LSE 加权合并局部输出的方法,以及不能等权平均的原因。
  • PV 后 rescale 的线性依据、正确性条件和有限精度边界。
  • 对应 kernel 计算顺序的纯 PyTorch 两阶段参考实现。

主题索引

  • DSA / DeepSeek Sparse Attention
  • MLA / Multi-head Latent Attention
  • Lightning Indexer
  • Sparse Attention top-k selection
  • IndexCache / IndexShare / idxcache
  • HISA / MISA / TISA / GVR Top-K
  • Sliding window KV / compressed KV
  • Long-context inference optimization
  • Numeric data types / quantization formats
  • FP8 / FP6 / FP4 / MXFP8 / MXFP6 / MXFP4 / NVFP4 / HiF8 / HiF4
  • LLM quantization / Weight-only / W8A8 / W4A4 / KV Cache quantization
  • Split-KV / Online Softmax / Log-Sum-Exp Reduce

About

记录学习的LLM notes

Resources

Stars

Watchers

Forks

Releases

Packages

Contributors