run-llama/llama_index · error · ValueError

Got a larger chunk overlap ({chunk_overlap}) than chunk size

Error message

Got a larger chunk overlap ({chunk_overlap}) than chunk size ({chunk_size}), should be smaller.

What it means

Error "Got a larger chunk overlap ({chunk_overlap}) than chunk size ({chunk_size}), should be smaller." thrown in run-llama/llama_index.

Source

Thrown at llama-index-core/llama_index/core/node_parser/text/token.py:65

    _tokenizer: Callable = PrivateAttr()
    _split_fns: List[Callable] = PrivateAttr()

    def __init__(
        self,
        chunk_size: int = DEFAULT_CHUNK_SIZE,
        chunk_overlap: int = DEFAULT_CHUNK_OVERLAP,
        tokenizer: Optional[Callable] = None,
        callback_manager: Optional[CallbackManager] = None,
        separator: str = " ",
        backup_separators: Optional[List[str]] = ["\n"],
        keep_whitespaces: bool = False,
        include_metadata: bool = True,
        include_prev_next_rel: bool = True,
        id_func: Optional[Callable[[int, Document], str]] = None,
    ):
        """Initialize with parameters."""
        if chunk_overlap > chunk_size:
            raise ValueError(
                f"Got a larger chunk overlap ({chunk_overlap}) than chunk size "
                f"({chunk_size}), should be smaller."
            )
        callback_manager = callback_manager or CallbackManager([])
        id_func = id_func or default_id_func
        super().__init__(
            chunk_size=chunk_size,
            chunk_overlap=chunk_overlap,
            separator=separator,
            backup_separators=backup_separators,
            keep_whitespaces=keep_whitespaces,
            callback_manager=callback_manager,
            include_metadata=include_metadata,
            include_prev_next_rel=include_prev_next_rel,
            id_func=id_func,
        )
        self._tokenizer = tokenizer or get_tokenizer()
        all_seps = [separator] + (backup_separators or [])

View on GitHub (pinned to afd0fef371)

Solutions

  1. Set chunk_overlap smaller than chunk_size in TokenTextSplitter.
  2. Increase chunk_size or decrease chunk_overlap.

When it happens

Trigger: Thrown at llama-index-core/llama_index/core/node_parser/text/token.py:65 when the library encounters an invalid state.

Common situations: See trigger scenarios.


AI-assisted analysis of run-llama/llama_index@afd0fef371 (2026-08-15). Data as JSON: /api/errors/c7b34b47ea63a643. Report an issue: GitHub.