ErrLookup › labmlai/annotated_deep_learning_paper_implementations
labmlai/annotated_deep_learning_paper_implementations
🧑🏫 60+ Implementations/tutorials of deep learning papers with side-by-side notes 📝; including transformers (original, xl, switch, feedback, vit, ...), optimizers (adam, adabelief, sophia, ...), gans(cyclegan, stylegan2, ...), 🎮 reinforcement learning (ppo, dqn), capsnet, distillation, ... 🧠 · Python · 222 source files
Analyzed at 33ab02281c on 2026-08-25. 10 documented errors.
| Code / Message | Type | Severity | Tags |
|---|---|---|---|
| Head size ${self.d_head} too large for Flash Attention | exception | error | pytorch, flash-attention, stable-diffusion, config |
| Head size {d_k} too large for flash attention | exception | error | pytorch, gpt-neox, flash-attention, config |
| Please install `bitsandbytes` with `pip install bitsandbytes | exception | error | python, pytorch, bitsandbytes, quantization, dependency |
| Invalid learning rate: {lr} | exception | error | python, pytorch, optimizer, hyperparameter, validation |
| Invalid epsilon value: {eps} | exception | error | python, pytorch, optimizer, hyperparameter, validation |
| Invalid beta parameter at index 0: {betas[0]} | exception | error | python, pytorch, optimizer, hyperparameter, validation |
| Invalid beta parameter at index 1: {betas[1]} | validation | error | python, pytorch, optimizer, hyperparameter, validation |
| GenericAdaptiveOptimizer does not support sparse gradients, | exception | error | python, pytorch, optimizer, sparse-gradients, embedding |
| Invalid weight_decay value: {weight_decay} | validation | error | python, pytorch, optimizer, hyperparameter, weight-decay, validation |
| Unknown variant {configs.glu_variant} | validation | error | python, pytorch, transformer, glu-variants, config, validation |