{"record":{"id":"47e526efeedccbb0","repo":"sgl-project/sglang","slug":"tokenspeed-mla-backend-is-only-supported-on-blackw","errorCode":null,"errorMessage":"tokenspeed_mla backend is only supported on Blackwell GPUs (SM100/SM12x).","messagePattern":"tokenspeed_mla backend is only supported on Blackwell GPUs \\(SM100/SM12x\\)\\.","errorType":"validation","errorClass":"ValueError","httpStatus":null,"severity":"error","filePath":"python/sglang/srt/arg_groups/overrides.py","lineNumber":2503,"sourceCode":"    the view).\"\"\"\n    if (\n        view.attention_backend == \"trtllm_mla\"\n        or view.decode_attention_backend == \"trtllm_mla\"\n    ):\n        if not is_blackwell_supported():\n            raise ValueError(\n                \"TRTLLM MLA backend is only supported on Blackwell GPUs (SM100/SM12x). Please use a different backend.\"\n            )\n        if view.kv_cache_dtype not in [\"fp8_e4m3\", \"fp4_e2m1\", \"bf16\", \"auto\"]:\n            raise ValueError(\n                \"TensorRT-LLM MLA backend only supports kv-cache-dtype of fp8_e4m3, fp4_e2m1, bf16, or auto.\"\n            )\n    if (\n        view.attention_backend == \"tokenspeed_mla\"\n        or view.decode_attention_backend == \"tokenspeed_mla\"\n    ):\n        if not is_blackwell_supported():\n            raise ValueError(\n                \"tokenspeed_mla backend is only supported on Blackwell GPUs (SM100/SM12x).\"\n            )\n        if view.kv_cache_dtype not in [\"fp8_e4m3\"]:\n            raise ValueError(\n                \"tokenspeed_mla backend requires kv-cache-dtype=fp8_e4m3, \"\n                f\"got {view.kv_cache_dtype}.\"\n            )\n    return {}\n\n\n@register_post_process\ndef _hisparse_validation(view: Any) -> dict:\n    \"\"\"Read-only validation pass: --enable-hisparse constraints (model class,\n    radix cache, kv dtype, DSA backends) read the resolved values through the\n    view.\"\"\"\n    from sglang.srt.arg_groups.hisparse_hook import validate_hisparse\n\n    validate_hisparse(view)","sourceCodeStart":2485,"sourceCodeEnd":2521,"githubUrl":"https://github.com/sgl-project/sglang/blob/0132848349585cfe6aae51c4941cbae872505f8a/python/sglang/srt/arg_groups/overrides.py#L2485-L2521","documentation":"SGLang rejects the tokenspeed_mla attention backend on non-Blackwell hardware. The TokenSpeed MLA kernels are compiled for SM100/SM12x (Blackwell) only, so enabling the backend on Hopper or older GPUs fails during server-args validation.","triggerScenarios":"Running with --attention-backend tokenspeed_mla or --decode-attention-backend tokenspeed_mla on a GPU whose compute capability is below SM100 (e.g. H100, A100, L40).","commonSituations":"Developers testing a Blackwell-targeted config on an H100 dev box, or CI runners without B200 access.","solutions":["Run on a Blackwell GPU (B200/GB200/SM100 or SM12x)","Switch to an attention backend supported by your hardware, e.g. --attention-backend flashmla or fa3"],"exampleFix":"# before (on H100)\n--attention-backend tokenspeed_mla\n# after\n--attention-backend flashmla --kv-cache-dtype fp8_e4m3","handlingStrategy":"validation","validationCode":"import torch\ncc = torch.cuda.get_device_capability()\nassert cc >= (10, 0), \"tokenspeed_mla requires Blackwell SM100/SM12x\"","typeGuard":null,"tryCatchPattern":null,"preventionTips":["Gate Blackwell-only backends on get_device_capability at deploy time","Keep hardware-conditional backend selection in your launcher"],"tags":["sglang","tokenspeed","mla","hardware-gpu","blackwell"],"backgroundTag":"gpu-architecture-not-supported","analyzedSha":"0132848349585cfe6aae51c4941cbae872505f8a","analyzedAt":"2026-08-28T05:10:05.995Z","schemaVersion":2},"datasetVersion":"2026-08-28T06:17:29.519Z"}