{"record":{"id":"2d05572c43d651f7","repo":"rohitg00/ai-engineering-from-scratch","slug":"expected-b-l-got-tuple-ids-shape","errorCode":null,"errorMessage":"expected (B, L), got {tuple(ids.shape)}","messagePattern":"expected \\(B, L\\), got (.+?)","errorType":"validation","errorClass":"ValueError","httpStatus":null,"severity":"error","filePath":"phases/19-capstone-projects/62-vision-language-pretraining/code/main.py","lineNumber":123,"sourceCode":"    \"\"\"\n    if logits.dim() != 3 or target_ids.dim() != 2:\n        raise ValueError(f\"logits must be 3D and targets 2D, got {logits.shape} {target_ids.shape}\")\n    b, l, v = logits.shape\n    flat_logits = logits.reshape(b * l, v)\n    flat_target = target_ids.reshape(b * l)\n    return F.cross_entropy(flat_logits, flat_target, ignore_index=padding_id)\n\n\nclass TextSideEncoder(nn.Module):\n    \"\"\"Tiny text encoder: embedding lookup + mean pool over non-padding tokens.\"\"\"\n\n    def __init__(self, vocab_size: int, embed_dim: int) -> None:\n        super().__init__()\n        self.embed = nn.Embedding(vocab_size, embed_dim, padding_idx=PAD_ID)\n\n    def forward(self, ids: torch.Tensor) -> torch.Tensor:\n        if ids.dim() != 2:\n            raise ValueError(f\"expected (B, L), got {tuple(ids.shape)}\")\n        x = self.embed(ids)\n        mask = (ids != PAD_ID).float().unsqueeze(-1)\n        denom = mask.sum(dim=1).clamp(min=1.0)\n        return (x * mask).sum(dim=1) / denom\n\n\nclass MultimodalModel(nn.Module):\n    \"\"\"Encoder + projection + text side + cross-attention decoder, all trainable.\"\"\"\n\n    def __init__(self, cfg: PretrainConfig) -> None:\n        super().__init__()\n        self.cfg = cfg\n\n        vit_cfg = ViTConfig(\n            image_size=32,\n            patch_size=16,\n            hidden=cfg.vision_hidden,\n            depth=2,","sourceCodeStart":105,"sourceCodeEnd":141,"githubUrl":"https://github.com/rohitg00/ai-engineering-from-scratch/blob/39ea8a1c6d0b61f071226eff7ede4d4105fed820/phases/19-capstone-projects/62-vision-language-pretraining/code/main.py#L105-L141","documentation":"Error \"expected (B, L), got {tuple(ids.shape)}\" thrown in rohitg00/ai-engineering-from-scratch.","triggerScenarios":"Thrown at phases/19-capstone-projects/62-vision-language-pretraining/code/main.py:123 when the library encounters an invalid state.","commonSituations":"See trigger scenarios.","solutions":[],"exampleFix":null,"handlingStrategy":null,"validationCode":null,"typeGuard":null,"tryCatchPattern":null,"preventionTips":[],"tags":[],"backgroundTag":null,"analyzedSha":"39ea8a1c6d0b61f071226eff7ede4d4105fed820","analyzedAt":"2026-08-26T03:13:46.626Z","schemaVersion":2},"datasetVersion":"2026-08-26T07:17:17.940Z"}