sgl-project/sglang · error · RuntimeError
dcp_kv_mask is not supported for FP4 KV cache.
Error message
dcp_kv_mask is not supported for FP4 KV cache.
What it means
Error "dcp_kv_mask is not supported for FP4 KV cache." thrown in sgl-project/sglang.
Source
Thrown at python/sglang/srt/mem_cache/memory_pool.py:2398
cache_k: torch.Tensor,
cache_v: torch.Tensor,
k_scale: Optional[float] = None,
v_scale: Optional[float] = None,
layer_id_override: Optional[int] = None,
dcp_kv_mask: Optional[torch.Tensor] = None,
):
loc, _, _ = unwrap_write_loc(loc_info)
# Catch stale slot ids here instead of as illegal-addr / silent KV
# corruption in the store_kvcache write (gated on SGLANG_ENABLE_ASYNC_ASSERT).
maybe_detect_oob(loc, 0, self.size + self.page_size, "set_kv_buffer (MHA)")
layer_id = (
layer_id_override if layer_id_override is not None else layer.layer_id
)
global_layer_id = layer.layer_id if layer is not None else layer_id
if self.is_quantized_kv_cache:
if dcp_kv_mask is not None:
raise RuntimeError("dcp_kv_mask is not supported for FP4 KV cache.")
self._set_quantized_kv_buffer(
layer_id,
global_layer_id,
loc,
cache_k,
cache_v,
k_scale,
v_scale,
)
return
if cache_k.dtype != self.dtype:
if k_scale is not None:
cache_k.div_(k_scale)
if v_scale is not None:
cache_v.div_(v_scale)
cache_k = cache_k.to(self.dtype)
cache_v = cache_v.to(self.dtype)View on GitHub (pinned to 0132848349)
When it happens
Trigger: Thrown at python/sglang/srt/mem_cache/memory_pool.py:2398 when the library encounters an invalid state.
Common situations: See trigger scenarios.
AI-assisted analysis of sgl-project/sglang@0132848349 (2026-08-28).
Data as JSON: /api/errors/e828d6be1468e137.
Report an issue: GitHub.