Lucene search
+L

5 matches found

PyPA
PyPA
•added 2026/09/10 9:45 a.m.•23 views

vLLM: Derender endpoints decode caller-supplied GenerateResponse token IDs without output bounds

SummaryThe /v1/completions/derender and /v1/chat/completions/derender endpoints accept caller-supplied GenerateResponse objects and postprocess every nested choices.tokenids list directly. Unlike the normal render/generate path, derender does not enforce model context length, resolved maxtokens,...

4.3CVSS5.8AI score0.00466EPSS
SaveExploits0References8Affected Software1
RedhatCVE
RedhatCVE
•added 2026/08/27 11:52 a.m.•11 views

CVE-2026-71486

A flaw was found in vLLM. An authenticated API client can exploit derender endpoints by providing oversized GenerateResponse objects. These endpoints process the objects without enforcing output bounds or response-size limits. This can lead to excessive consumption of CPU and memory resources,...

4.3CVSS5.4AI score0.00466EPSS
SaveExploits0References7
Snyk
Snyk
•added 2026/08/18 12:47 a.m.•17 views

Allocation of Resources Without Limits or Throttling

Overview vllm is an A high-throughput and memory-efficient inference and serving engine for LLMs Affected versions of this package are vulnerable to Allocation of Resources Without Limits or Throttling via the derender endpoints derenderchatresponse and derendercompletionresponse in...

5.3CVSS5.6AI score0.00466EPSS
SaveExploits0References2
Cvelist
Cvelist
•added 2026/08/17 8:13 p.m.•36 views

CVE-2026-71486 vLLM: Derender endpoints decode caller-supplied GenerateResponse token IDs without output bounds

vLLM is an inference and serving engine for large language models. Prior to 0.26.0, the /v1/completions/derender and /v1/chat/completions/derender endpoints accept caller-supplied GenerateResponse objects whose generateresponses, choices, tokenids, promptlogprobs, logprobs.content, toplogprobs, a...

4.3CVSS0.00466EPSS
SaveExploits0References4
Vulnrichment
Vulnrichment
•added 2026/08/17 8:13 p.m.•7 views

CVE-2026-71486 vLLM: Derender endpoints decode caller-supplied GenerateResponse token IDs without output bounds

vLLM is an inference and serving engine for large language models. Prior to 0.26.0, the /v1/completions/derender and /v1/chat/completions/derender endpoints accept caller-supplied GenerateResponse objects whose generateresponses, choices, tokenids, promptlogprobs, logprobs.content, toplogprobs, a...

4.3CVSS5.4AI score0.00466EPSS
SaveExploits0References4
Rows per page
Query Builder