{"record":{"id":"9044e120cdf7a639","repo":"huggingface/candle","slug":"seqlens-k-must-be-a-cuda-tensor-9044e1","errorCode":null,"errorMessage":"seqlens_k must be a cuda tensor","messagePattern":"seqlens_k must be a cuda tensor","errorType":"validation","errorClass":null,"httpStatus":null,"severity":"error","filePath":"candle-flash-attn/src/lib.rs","lineNumber":494,"sourceCode":"        // https://github.com/Dao-AILab/flash-attention/blob/184b992dcb2a0890adaa19eb9b541c3e4f9d2a08/csrc/flash_attn/flash_api.cpp#L327\n        let dev = q.device();\n        let out_shape = q_l.shape().clone();\n        let out_l = Layout::contiguous(&out_shape);\n\n        let (seqlens_q, seqlens_q_layout) = self.seqlens_q.storage_and_layout();\n        let seqlens_q = match &*seqlens_q {\n            candle::Storage::Cuda(c) => c.as_cuda_slice::<u32>()?, // Should be i32!\n            _ => candle::bail!(\"seqlens_q must be a cuda tensor\"),\n        };\n        let seqlens_q = match seqlens_q_layout.contiguous_offsets() {\n            Some((o1, o2)) => seqlens_q.slice(o1..o2),\n            None => candle::bail!(\"seqlens_q has to be contiguous\"),\n        };\n\n        let (seqlens_k, seqlens_k_layout) = self.seqlens_k.storage_and_layout();\n        let seqlens_k = match &*seqlens_k {\n            candle::Storage::Cuda(c) => c.as_cuda_slice::<u32>()?, // Should be i32!\n            _ => candle::bail!(\"seqlens_k must be a cuda tensor\"),\n        };\n        let seqlens_k = match seqlens_k_layout.contiguous_offsets() {\n            Some((o1, o2)) => seqlens_k.slice(o1..o2),\n            None => candle::bail!(\"seqlens_k has to be contiguous\"),\n        };\n\n        let block_table = if let Some(block_table) = self.block_table.as_ref() {\n            let (block_table_storage, block_table_layout) = block_table.storage_and_layout();\n            match &*block_table_storage {\n                candle::Storage::Cuda(_) => {}\n                _ => candle::bail!(\"block_table must be a cuda tensor\"),\n            }\n            let block_table_stride = block_table_layout.shape().dims2()?.1;\n            if block_table_layout.stride().last().copied() != Some(1) {\n                candle::bail!(\"block_table last dimension must be contiguous\")\n            }\n            Some((\n                block_table_storage,","sourceCodeStart":476,"sourceCodeEnd":512,"githubUrl":"https://github.com/huggingface/candle/blob/d5fee525bfde3273eb7c9b75fd2bc4937be867ca/candle-flash-attn/src/lib.rs#L476-L512","documentation":"Raised during flash-attn v2 forward with variable-length sequences in candle-flash-attn/src/lib.rs when `seqlens_k` is provided but its storage is not CUDA memory. seqlens_k (per-batch key sequence lengths as u32/i32) must live on the CUDA device so it can be passed as a device slice to the kernel.","triggerScenarios":"Calling flash_attn_varlen with seqlens_k created on/left on the CPU device while other inputs are on CUDA.","commonSituations":"Moving only q/k/v/seqlens_q to GPU and forgetting seqlens_k; constructing k-side batch metadata separately on CPU.","solutions":["Call .to_device(&dev) on seqlens_k before the call","Create both seqlens tensors on the same CUDA device as q/k/v","Add a device equality assert for all kernel inputs in your model forward"],"exampleFix":"// before\nlet seqlens_k = Tensor::from_vec(kv_lens, (batch + 1,), &Device::Cpu)?;\n// after\nlet seqlens_k = Tensor::from_vec(kv_lens, (batch + 1,), &Device::Cpu)?.to_device(&dev)?;","handlingStrategy":"validation","validationCode":"fn ensure_u32_cuda_k(t: &Tensor) -> candle::Result<Tensor> {\n    if t.dtype() != candle::DType::U32 { candle::bail!(\"seqlens_k must be u32\"); }\n    if t.device().is_cuda() { Ok(t.clone()) } else { t.to_device(&Device::new_cuda(0)?) }\n}","typeGuard":"fn seqlens_k_ready(t: &Tensor) -> bool { t.dtype() == candle::DType::U32 && t.device().is_cuda() }","tryCatchPattern":"let seqlens_k = seqlens_k.to_device(q.device())?;\nmatch flash_attn_varlen(&q, &k, &v, &seqlens_q, &seqlens_k, scale, max_q, max_k, None, None, None) {\n    Err(e) if e.to_string().contains(\"seqlens_k must be a cuda tensor\") => { /* fix device, retry */ }\n    r => r?,\n}","preventionTips":["Move q, k, v, seqlens_q, seqlens_k together with a single prepare step","Assert device equality of all inputs before the call","Construct k-side metadata on the CUDA device"],"tags":["cuda","flash-attention","device-mismatch","varlen"],"backgroundTag":"tensor-device-mismatch","analyzedSha":"d5fee525bfde3273eb7c9b75fd2bc4937be867ca","analyzedAt":"2026-09-02T00:15:47.023Z","contentChangedAt":null,"schemaVersion":2},"datasetVersion":"2026-09-09T06:17:21.866Z"}