[Bugfix] Zero-init MLA attention output buffers to prevent NaN from CUDA graph padding #37442
[Bugfix] Zero-init attention output buffers to prevent NaN from CUDA …
fe46b004
elvircrn
force pushed
to
fe46b004
137 days ago
Fix FlashInfer MLA output buffer shape for multi-token queries (spec …
62b4a62a
Fix FlashInfer MLA: only pass out= for single-token decode
c61c998c
Zero after kernel for q_len > 1
ac29832e
Labels
bug
ready
v1
nvidia
Login to write a write a comment.
Login via GitHub