{"record":{"id":"88194c68e158508a","repo":"rohitg00/ai-engineering-from-scratch","slug":"chunk-size-must-be-positive","errorCode":null,"errorMessage":"chunk_size must be positive","messagePattern":"chunk_size must be positive","errorType":"validation","errorClass":"ValueError","httpStatus":null,"severity":"error","filePath":"phases/19-capstone-projects/43-hdf5-tokenized-corpus/code/main.py","lineNumber":117,"sourceCode":"        byte_ids = [int(i) - self.BYTE_OFFSET for i in ids if int(i) >= self.BYTE_OFFSET]\n        return bytes(byte_ids).decode(\"utf-8\", errors=\"replace\")\n\n\nclass HDF5ShardWriter:\n    \"\"\"Stream tokens into a resizable HDF5 dataset with chunk-sized buffering.\n\n    Open in a `with` block to guarantee the residual buffer is flushed and the\n    closing attributes (token_count, sha256) are written.\n    \"\"\"\n\n    def __init__(\n        self,\n        path: Path,\n        chunk_size: int = DEFAULT_CHUNK_SIZE,\n        dataset_name: str = \"tokens\",\n    ) -> None:\n        if chunk_size <= 0:\n            raise ValueError(\"chunk_size must be positive\")\n        self.path = Path(path)\n        self.chunk_size = chunk_size\n        self.dataset_name = dataset_name\n        self._buffer: list[int] = []\n        self._token_count = 0\n        self._document_count = 0\n        self._hasher = hashlib.sha256()\n        self._file: h5py.File | None = None\n        self._dataset: h5py.Dataset | None = None\n\n    def __enter__(self) -> \"HDF5ShardWriter\":\n        self._file = h5py.File(self.path, \"w\", libver=\"latest\")\n        self._dataset = self._file.create_dataset(\n            self.dataset_name,\n            shape=(0,),\n            maxshape=(None,),\n            chunks=(self.chunk_size,),\n            dtype=TOKEN_DTYPE,","sourceCodeStart":99,"sourceCodeEnd":135,"githubUrl":"https://github.com/rohitg00/ai-engineering-from-scratch/blob/39ea8a1c6d0b61f071226eff7ede4d4105fed820/phases/19-capstone-projects/43-hdf5-tokenized-corpus/code/main.py#L99-L135","documentation":"Error \"chunk_size must be positive\" thrown in rohitg00/ai-engineering-from-scratch.","triggerScenarios":"Thrown at phases/19-capstone-projects/43-hdf5-tokenized-corpus/code/main.py:117 when the library encounters an invalid state.","commonSituations":"See trigger scenarios.","solutions":[],"exampleFix":null,"handlingStrategy":null,"validationCode":null,"typeGuard":null,"tryCatchPattern":null,"preventionTips":[],"tags":[],"backgroundTag":null,"analyzedSha":"39ea8a1c6d0b61f071226eff7ede4d4105fed820","analyzedAt":"2026-08-26T03:13:46.626Z","schemaVersion":2},"datasetVersion":"2026-08-26T07:17:17.940Z"}