onnxruntime
[CUDA] Add FP16-cache paged XQA decode for head size 256
#32263
Merged

[CUDA] Add FP16-cache paged XQA decode for head size 256 #32263

baijumeswani
baijumeswani baijumeswani requested a review from copilot-pull-request-reviewer copilot-pull-request-reviewer 30 days ago
copilot-pull-request-reviewer
copilot-pull-request-reviewer commented on 2026-08-25
baijumeswani baijumeswani force pushed from 75ba73ae to af085e8e 30 days ago
baijumeswani baijumeswani requested a review from copilot-pull-request-reviewer copilot-pull-request-reviewer 30 days ago
copilot-pull-request-reviewer
copilot-pull-request-reviewer commented on 2026-08-25
baijumeswani Optimize FP16 long-context paged decode with XQA
7c592b8b
baijumeswani baijumeswani force pushed from af085e8e to 7c592b8b 30 days ago
tianleiwu
tianleiwu approved these changes on 2026-08-26
baijumeswani baijumeswani enabled auto-merge (squash) 30 days ago
baijumeswani baijumeswani merged b1f76d58 into main 29 days ago
baijumeswani baijumeswani deleted the baijumeswani/fp16-paged-xqa-pr branch 29 days ago

Login to write a write a comment.

Login via GitHub

Assignees
No one assigned
Labels
Milestone