{"record":{"id":"6ad2793b60d144ee","repo":"lllyasviel/ControlNet","slug":"invalid-weight-decay-value","errorCode":null,"errorMessage":"Invalid weight_decay value: {}","messagePattern":"Invalid weight_decay value: (.+?)","errorType":"validation","errorClass":"ValueError","httpStatus":null,"severity":"error","filePath":"ldm/util.py","lineNumber":105,"sourceCode":"    return getattr(importlib.import_module(module, package=None), cls)\n\n\nclass AdamWwithEMAandWings(optim.Optimizer):\n    # credit to https://gist.github.com/crowsonkb/65f7265353f403714fce3b2595e0b298\n    def __init__(self, params, lr=1.e-3, betas=(0.9, 0.999), eps=1.e-8,  # TODO: check hyperparameters before using\n                 weight_decay=1.e-2, amsgrad=False, ema_decay=0.9999,   # ema decay to match previous code\n                 ema_power=1., param_names=()):\n        \"\"\"AdamW that saves EMA versions of the parameters.\"\"\"\n        if not 0.0 <= lr:\n            raise ValueError(\"Invalid learning rate: {}\".format(lr))\n        if not 0.0 <= eps:\n            raise ValueError(\"Invalid epsilon value: {}\".format(eps))\n        if not 0.0 <= betas[0] < 1.0:\n            raise ValueError(\"Invalid beta parameter at index 0: {}\".format(betas[0]))\n        if not 0.0 <= betas[1] < 1.0:\n            raise ValueError(\"Invalid beta parameter at index 1: {}\".format(betas[1]))\n        if not 0.0 <= weight_decay:\n            raise ValueError(\"Invalid weight_decay value: {}\".format(weight_decay))\n        if not 0.0 <= ema_decay <= 1.0:\n            raise ValueError(\"Invalid ema_decay value: {}\".format(ema_decay))\n        defaults = dict(lr=lr, betas=betas, eps=eps,\n                        weight_decay=weight_decay, amsgrad=amsgrad, ema_decay=ema_decay,\n                        ema_power=ema_power, param_names=param_names)\n        super().__init__(params, defaults)\n\n    def __setstate__(self, state):\n        super().__setstate__(state)\n        for group in self.param_groups:\n            group.setdefault('amsgrad', False)\n\n    @torch.no_grad()\n    def step(self, closure=None):\n        \"\"\"Performs a single optimization step.\n        Args:\n            closure (callable, optional): A closure that reevaluates the model\n                and returns the loss.","sourceCodeStart":87,"sourceCodeEnd":123,"githubUrl":"https://github.com/lllyasviel/ControlNet/blob/ed85cd1e25a5ed592f7d8178495b4483de0331bf/ldm/util.py#L87-L123","documentation":"Raised by the EMA-tracking AdamW optimizer when weight_decay is negative (weight_decay < 0.0). This optimizer (unlike some SGD variants) only accepts zero or positive weight decay; a negative value aborts construction.","triggerScenarios":"Constructing AdamW(params, weight_decay=-1e-2), or configs where weight decay was entered with a minus sign intending a larger effective lr (a misunderstanding of decoupled weight decay).","commonSituations":"Sign typos in YAML/JSON training configs, hyperparameter search sampling negative values, or porting configs from optimizers that interpret weight decay differently.","solutions":["Fix the sign: use a small non-negative value like 0.01 or 0.0 to disable","If using a sweep, bound weight_decay to [0.0, 1e-1]","Add pre-construction validation of the optimizer kwargs dict"],"exampleFix":"# before\nopt = AdamW(params, weight_decay=-1e-2)\n# after\nopt = AdamW(params, weight_decay=1e-2)","handlingStrategy":"validation","validationCode":"assert 0.0 <= weight_decay, f'bad weight_decay: {weight_decay}'","typeGuard":null,"tryCatchPattern":null,"preventionTips":["Use 0.0 to disable weight decay, never negative values","Bound sweeps to non-negative weight decay","Centralize optimizer-kwargs validation in training scripts"],"tags":["optimizer","adamw","weight-decay","diffusion-training","validation"],"backgroundTag":"invalid-optimizer-hyperparameter","analyzedSha":"ed85cd1e25a5ed592f7d8178495b4483de0331bf","analyzedAt":"2026-08-27T12:58:54.167Z","schemaVersion":2},"datasetVersion":"2026-08-27T13:17:12.746Z"}