vllm
[Bugfix] Zero-init MLA attention output buffers to prevent NaN from CUDA graph padding
#37442
Merged

[Bugfix] Zero-init MLA attention output buffers to prevent NaN from CUDA graph padding #37442

elvircrn
elvircrn elvircrn requested a review from pavanimajety pavanimajety 137 days ago
mergify mergify added nvidia
mergify mergify added v1
mergify mergify added bug
elvircrn elvircrn force pushed 137 days ago
gemini-code-assist
gemini-code-assist commented on 2026-03-18
elvircrn elvircrn force pushed 137 days ago
elvircrn [Bugfix] Zero-init attention output buffers to prevent NaN from CUDA …
fe46b004
elvircrn elvircrn force pushed to fe46b004 137 days ago
tlrmchlsmth tlrmchlsmth added ready
elvircrn Fix FlashInfer MLA output buffer shape for multi-token queries (spec …
62b4a62a
elvircrn Fix FlashInfer MLA: only pass out= for single-token decode
c61c998c
MatthewBonanni Zero after kernel for q_len > 1
ac29832e
MatthewBonanni
tlrmchlsmth
tlrmchlsmth approved these changes on 2026-03-18
tlrmchlsmth tlrmchlsmth enabled auto-merge (squash) 137 days ago
tlrmchlsmth tlrmchlsmth assigned tlrmchlsmth tlrmchlsmth 137 days ago
tlrmchlsmth tlrmchlsmth merged ef2c4f77 into main 137 days ago
hjjq

Login to write a write a comment.

Login via GitHub

Assignees
Labels
Milestone