{"id":"CVE-2026-71486","aliases":["GHSA-8737-qx52-hjff"],"url":"https://o3.security/vulnerability/CVE-2026-71486","summary":"vLLM: Derender endpoints decode caller-supplied GenerateResponse token IDs without output bounds","details":"vLLM is an inference and serving engine for large language models. Prior to 0.26.0, the /v1/completions/derender and /v1/chat/completions/derender endpoints accept caller-supplied GenerateResponse objects whose generate_responses, choices, token_ids, prompt_logprobs, logprobs.content, top_logprobs, and routed_experts structures are processed by OnlineDerenderer and tokenizer.decode before max_model_len, max_tokens, max_num_seqs, or response-size limits are enforced, allowing an authenticated API client to consume excessive CPU and memory and produce oversized responses. This issue is fixed in version 0.26.0.","published":"2026-08-17T20:13:06.289Z","modified":"2026-08-20T03:30:40.445983804Z","cvss":{"score":4.3,"severity":"MEDIUM","vector":"CVSS:3.1/AV:N/AC:L/PR:L/UI:N/S:U/C:N/I:N/A:L"},"epss":null,"cisaKev":null,"exploitsKnown":null,"affectedPackages":[{"ecosystem":"PyPI","name":"vllm","fixedVersion":"0.26.0"}],"fix":{"url":"https://github.com/vllm-project/vllm/commit/8e61b646e2d157f9b93451fa048f9c8530c8a67b","label":"vllm-project/vllm@8e61b64"},"references":[{"type":"WEB","url":"https://github.com/vllm-project/vllm/releases/tag/v0.26.0"},{"type":"ADVISORY","url":"https://github.com/CVEProject/cvelistV5/tree/main/cves/2026/71xxx/CVE-2026-71486.json"},{"type":"ADVISORY","url":"https://github.com/vllm-project/vllm/security/advisories/GHSA-8737-qx52-hjff"},{"type":"ADVISORY","url":"https://nvd.nist.gov/vuln/detail/CVE-2026-71486"},{"type":"FIX","url":"https://github.com/vllm-project/vllm/commit/8e61b646e2d157f9b93451fa048f9c8530c8a67b"},{"type":"FIX","url":"https://github.com/vllm-project/vllm/pull/47260"}],"provenance":{"sources":["OSV.dev","FIRST.org (EPSS)"],"lastVerified":"2026-08-20T03:30:40.445983804Z"}}