ErrLookup › labmlai/annotated_deep_learning_paper_implementations

labmlai/annotated_deep_learning_paper_implementations

🧑‍🏫 60+ Implementations/tutorials of deep learning papers with side-by-side notes 📝; including transformers (original, xl, switch, feedback, vit, ...), optimizers (adam, adabelief, sophia, ...), gans(cyclegan, stylegan2, ...), 🎮 reinforcement learning (ppo, dqn), capsnet, distillation, ... 🧠 · Python · 222 source files

Analyzed at 33ab02281c on 2026-08-25. 10 documented errors.

Code / MessageTypeSeverityTags
Head size ${self.d_head} too large for Flash Attention
exception error pytorch, flash-attention, stable-diffusion, config
Head size {d_k} too large for flash attention
exception error pytorch, gpt-neox, flash-attention, config
Please install `bitsandbytes` with `pip install bitsandbytes
exception error python, pytorch, bitsandbytes, quantization, dependency
Invalid learning rate: {lr}
exception error python, pytorch, optimizer, hyperparameter, validation
Invalid epsilon value: {eps}
exception error python, pytorch, optimizer, hyperparameter, validation
Invalid beta parameter at index 0: {betas[0]}
exception error python, pytorch, optimizer, hyperparameter, validation
Invalid beta parameter at index 1: {betas[1]}
validation error python, pytorch, optimizer, hyperparameter, validation
GenericAdaptiveOptimizer does not support sparse gradients,
exception error python, pytorch, optimizer, sparse-gradients, embedding
Invalid weight_decay value: {weight_decay}
validation error python, pytorch, optimizer, hyperparameter, weight-decay, validation
Unknown variant {configs.glu_variant}
validation error python, pytorch, transformer, glu-variants, config, validation