{"record":{"id":"8e6dee0a006049d3","repo":"huggingface/pytorch-image-models","slug":"invalid-learning-rate-8e6dee","errorCode":null,"errorMessage":"Invalid learning rate: {}","messagePattern":"Invalid learning rate: (.+?)","errorType":"validation","errorClass":"ValueError","httpStatus":null,"severity":"error","filePath":"timm/optim/adan.py","lineNumber":74,"sourceCode":"        eps: Term added to the denominator to improve numerical stability.\n        weight_decay: Decoupled weight decay (L2 penalty)\n        no_prox: How to perform the weight decay\n        caution: Enable caution from 'Cautious Optimizers'\n        foreach: If True would use torch._foreach implementation. Faster but uses slightly more memory.\n    \"\"\"\n\n    def __init__(self,\n            params,\n            lr: float = 1e-3,\n            betas: Tuple[float, float, float] = (0.98, 0.92, 0.99),\n            eps: float = 1e-8,\n            weight_decay: float = 0.0,\n            no_prox: bool = False,\n            caution: bool = False,\n            foreach: Optional[bool] = None,\n    ):\n        if not 0.0 <= lr:\n            raise ValueError('Invalid learning rate: {}'.format(lr))\n        if not 0.0 <= eps:\n            raise ValueError('Invalid epsilon value: {}'.format(eps))\n        if not 0.0 <= betas[0] < 1.0:\n            raise ValueError('Invalid beta parameter at index 0: {}'.format(betas[0]))\n        if not 0.0 <= betas[1] < 1.0:\n            raise ValueError('Invalid beta parameter at index 1: {}'.format(betas[1]))\n        if not 0.0 <= betas[2] < 1.0:\n            raise ValueError('Invalid beta parameter at index 2: {}'.format(betas[2]))\n\n        defaults = dict(\n            lr=lr,\n            betas=betas,\n            eps=eps,\n            weight_decay=weight_decay,\n            no_prox=no_prox,\n            caution=caution,\n            foreach=foreach,\n        )","sourceCodeStart":56,"sourceCodeEnd":92,"githubUrl":"https://github.com/huggingface/pytorch-image-models/blob/9a5261e31b3b5128526eb2658333b4c0a54464ae/timm/optim/adan.py#L56-L92","documentation":"Raised by timm's Adan (Adaptive Nesterov Momentum) optimizer constructor when the learning rate is negative. Adan requires lr >= 0 because the update is a scaled descent step along the aggregated gradient direction.","triggerScenarios":"Calling timm.optim.Adan(params, lr=value) with value < 0.0, e.g. lr=-1e-3 or a negative value read from a config/CLI.","commonSituations":"Sign error in hyperparameter sweeps, a YAML value like lr: -1e-3 from a template, or misparsed scientific notation from CLI args.","solutions":["Use a non-negative learning rate, typically 1e-3 to 1e-2 for Adan","Check config files and CLI parsing for a stray minus sign or bad float parse"],"exampleFix":"# before\nopt = timm.optim.Adan(model.parameters(), lr=-1e-3)\n# after\nopt = timm.optim.Adan(model.parameters(), lr=1e-3)","handlingStrategy":"validation","validationCode":"assert lr >= 0.0, f'lr must be >= 0, got {lr}'","typeGuard":"def valid_lr(lr) -> bool:\n    return (isinstance(lr, (int, float)) and lr >= 0.0)","tryCatchPattern":null,"preventionTips":["Bound lr sweeps to positive ranges","Validate config before constructing optimizers","Log resolved hyperparameters at startup"],"tags":["optimizer","adan","hyperparameters","validation"],"backgroundTag":"optimizer-hyperparameter-out-of-range","analyzedSha":"9a5261e31b3b5128526eb2658333b4c0a54464ae","analyzedAt":"2026-08-27T02:34:25.417Z","schemaVersion":2},"datasetVersion":"2026-08-27T03:17:27.898Z"}