{"record":{"id":"1851beb9ea70e133","repo":"rohitg00/ai-engineering-from-scratch","slug":"logits-must-be-3d-and-targets-2d-got-logits-shap","errorCode":null,"errorMessage":"logits must be 3D and targets 2D, got {logits.shape} {target_ids.shape}","messagePattern":"logits must be 3D and targets 2D, got (.+?) (.+?)","errorType":"validation","errorClass":"ValueError","httpStatus":null,"severity":"error","filePath":"phases/19-capstone-projects/62-vision-language-pretraining/code/main.py","lineNumber":107,"sourceCode":"    scale = log_tau.exp().clamp(min=1e-3, max=100.0)\n    sim = (img_n @ txt_n.T) * scale\n\n    targets = torch.arange(n, device=sim.device)\n    loss_i2t = F.cross_entropy(sim, targets)\n    loss_t2i = F.cross_entropy(sim.T, targets)\n    return (loss_i2t + loss_t2i) * 0.5, sim\n\n\ndef lm_loss(logits: torch.Tensor, target_ids: torch.Tensor,\n            padding_id: int = PAD_ID) -> torch.Tensor:\n    \"\"\"Next-token cross-entropy with padding masked.\n\n    `logits` shape is (B, L, V). `target_ids` shape is (B, L). The shift is\n    applied outside this function so the caller controls which positions are\n    predictions and which are inputs.\n    \"\"\"\n    if logits.dim() != 3 or target_ids.dim() != 2:\n        raise ValueError(f\"logits must be 3D and targets 2D, got {logits.shape} {target_ids.shape}\")\n    b, l, v = logits.shape\n    flat_logits = logits.reshape(b * l, v)\n    flat_target = target_ids.reshape(b * l)\n    return F.cross_entropy(flat_logits, flat_target, ignore_index=padding_id)\n\n\nclass TextSideEncoder(nn.Module):\n    \"\"\"Tiny text encoder: embedding lookup + mean pool over non-padding tokens.\"\"\"\n\n    def __init__(self, vocab_size: int, embed_dim: int) -> None:\n        super().__init__()\n        self.embed = nn.Embedding(vocab_size, embed_dim, padding_idx=PAD_ID)\n\n    def forward(self, ids: torch.Tensor) -> torch.Tensor:\n        if ids.dim() != 2:\n            raise ValueError(f\"expected (B, L), got {tuple(ids.shape)}\")\n        x = self.embed(ids)\n        mask = (ids != PAD_ID).float().unsqueeze(-1)","sourceCodeStart":89,"sourceCodeEnd":125,"githubUrl":"https://github.com/rohitg00/ai-engineering-from-scratch/blob/39ea8a1c6d0b61f071226eff7ede4d4105fed820/phases/19-capstone-projects/62-vision-language-pretraining/code/main.py#L89-L125","documentation":"Error \"logits must be 3D and targets 2D, got {logits.shape} {target_ids.shape}\" thrown in rohitg00/ai-engineering-from-scratch.","triggerScenarios":"Thrown at phases/19-capstone-projects/62-vision-language-pretraining/code/main.py:107 when the library encounters an invalid state.","commonSituations":"See trigger scenarios.","solutions":[],"exampleFix":null,"handlingStrategy":null,"validationCode":null,"typeGuard":null,"tryCatchPattern":null,"preventionTips":[],"tags":[],"backgroundTag":null,"analyzedSha":"39ea8a1c6d0b61f071226eff7ede4d4105fed820","analyzedAt":"2026-08-26T03:13:46.626Z","schemaVersion":2},"datasetVersion":"2026-08-26T07:17:17.940Z"}