llama.cpp
ggml : optimize cuda cumsum fallback (~2.5x speedup vs CUB)
#18343
Merged

ggml : optimize cuda cumsum fallback (~2.5x speedup vs CUB) #18343

Aadeshveer
github-actions github-actions added Nvidia GPU
github-actions github-actions added ggml
am17an
Aadeshveer
am17an
Aadeshveer
am17an
am17an
am17an commented on 2025-12-24
Aadeshveer Aadeshveer force pushed 269 days ago
Aadeshveer
Aadeshveer Aadeshveer force pushed 269 days ago
am17an
Aadeshveer Aadeshveer force pushed 269 days ago
Aadeshveer
Aadeshveer Aadeshveer force pushed 269 days ago
Aadeshveer Aadeshveer requested a review from am17an am17an 269 days ago
Aadeshveer Aadeshveer force pushed 269 days ago
am17an
am17an approved these changes on 2025-12-24
Aadeshveer ggml : optimize cuda cumsum fallback kernel
4bc188b9
Aadeshveer Aadeshveer force pushed to 4bc188b9 269 days ago
Aadeshveer
am17an am17an merged c54bba86 into master 268 days ago
CISC
jeffbolznv
am17an
jeffbolznv

Login to write a write a comment.

Login via GitHub

Reviewers
Assignees
No one assigned
Labels
Milestone