Skip to content

Repository files navigation

Outline for Mastering LLMs (with Subtopics)

alt text

0. Prerequisites

1. Foundations

2. Data

  • Dataset selection
    • Important data sources and licenses
    • Data diversity and bias considerations
    • Data scaling laws: https://arxiv.org/abs/2203.15556
    • Synthetic data generation; importantce; problems
  • Dataset cleaning and normalization
    • Deduplication
    • Data preprocessing
    • Filtering and quality checks
  • Tokenizer
    • Byte Pair Encoding (BPE)
    • SentencePiece
    • Tokenization efficiencies and tradeoffs

3. Model Architectures

4. Optimization & Training

Some techniques to know

  • Curriculum Learning
  • Data Packing (Mixture / Packing)
  • Gradient Clipping
  • Mixed Precision (FP16/BF16)
  • Activation Checkpointing
  • ZeRO / Sharded Data Parallelism
  • Weight tying
  • Layer sharing
  • KV cache layout and memory
  • Distillation
  • Auxiliary heads

5. Fine-Tuning & Preference Learning

6. Inference & Systems

  • Inference optimization
  • Sparse and hybrid scaling
    • Exploiting sparsity for efficiency
    • Hybrid model deployments
  • Post-attention innovations
    • QK-Norm (RMSNorm on queries/keys pre-RoPE)
    • Multi-Token Prediction (speculative decoding)
  • Tool call
    • Integrating external tools and APIs
  • RAG (Retrieval-Augmented Generation)
    • Retrieval integration
    • Memory and knowledge augmentation
  • Multimodality
    • Multimodal training strategies
    • Vision-language models

7. Evaluation & Safety

  • Benchmarking
  • Human evaluation
    • Manual assessment protocols
    • Crowdsourced evaluation
  • Red teaming and jailbreaking
    • Adversarial testing
    • Jailbreak detection and mitigation
  • Interpretability
    • Model probing techniques
    • Visualization of attention and activations

Other useful resources

Popular tutorials/ projects

  • Make a tokenizer from scratch
  • Implement the muon optimizer
  • Implement all the attention mechanism which are relevant
  • Implement embeddings like RoPE
  • Try out different types and styles of normalization
  • Implement the Mamba architecture
  • Integrate QLoRA fine-tuning
  • Create a full Mixture of Experts (MoE) based LLM
    • Experiment with types of activation functions
    • Explore various optimizers
    • Apply RLHF and DPO techniques
    • Integrate FlashAttention
    • Quantize it into 4-bit or something similar
    • Add optimizations such as KV cache

Super optional

  • Create a multimodal integrated LLM
  • Add RAG and tool-calling capabilities

About

learning everything about modern LLMs

Resources

Stars

3 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages