llama.cpp
CUDA: adding switch points per HW and quant type to tune the mvq->MMQ decode crossover
#26079
Merged

CUDA: adding switch points per HW and quant type to tune the mvq->MMQ decode crossover #26079

praneshgo
github-actions github-actions added ggml
github-actions github-actions added CUDA
praneshgo
gaugarg-nv
gaugarg-nv requested changes on 2026-07-27
ORippler
ORippler commented on 2026-07-27
praneshgo
praneshgo praneshgo requested a review from gaugarg-nv gaugarg-nv 31 days ago
praneshgo CUDA: runtime GGML_CUDA_MMVQ_MAX to tune the mvq->MMQ decode crossover
ff05098b
praneshgo Added Blackwell specific switch point, to reduce dependence on runtim…
f2a3efae
github-actions github-actions added documentation
github-actions github-actions added model
github-actions github-actions added build
github-actions github-actions added testing
github-actions github-actions added Vulkan
github-actions github-actions added devops
github-actions github-actions added server
github-actions github-actions added SYCL
github-actions github-actions added Apple Metal
github-actions github-actions added OpenCL
github-actions github-actions added Hexagon
github-actions github-actions added mtmd
github-actions github-actions added WebGPU
github-actions github-actions added server/ui
github-actions github-actions added conversion
github-actions github-actions added vendor
praneshgo praneshgo force pushed 29 days ago
praneshgo praneshgo changed the title CUDA: runtime GGML_CUDA_MMVQ_MAX to tune the mvq->MMQ decode crossover CUDA: adding switch points per HW and quant type to tune the mvq->MMQ decode crossover 29 days ago
praneshgo praneshgo requested a review from ORippler ORippler 29 days ago
gaugarg-nv gaugarg-nv removed model
gaugarg-nv gaugarg-nv removed build
gaugarg-nv gaugarg-nv removed testing
gaugarg-nv gaugarg-nv removed Vulkan
gaugarg-nv gaugarg-nv removed devops
gaugarg-nv gaugarg-nv removed server
gaugarg-nv gaugarg-nv removed SYCL
gaugarg-nv gaugarg-nv removed Apple Metal
gaugarg-nv gaugarg-nv removed OpenCL
gaugarg-nv gaugarg-nv removed Hexagon
gaugarg-nv gaugarg-nv removed mtmd
gaugarg-nv gaugarg-nv removed WebGPU
gaugarg-nv gaugarg-nv removed server/ui
gaugarg-nv gaugarg-nv removed conversion
gaugarg-nv gaugarg-nv removed vendor
gaugarg-nv gaugarg-nv removed documentation
praneshgo Add per-HW switch point values for DGX Spark and removing runtime env…
f2aace7f
praneshgo praneshgo force pushed to f2aace7f 28 days ago
praneshgo Adding switch points for Ada, tested on RTX 4090
db1508d8
praneshgo
praneshgo
gaugarg-nv
gaugarg-nv commented on 2026-08-03
praneshgo Modifying DGX Spark numbers based on latest run and adding some comme…
9052a5ce
praneshgo praneshgo requested a review from gaugarg-nv gaugarg-nv 24 days ago
praneshgo praneshgo marked this pull request as ready for review 24 days ago
praneshgo praneshgo requested a review 24 days ago
gaugarg-nv
gaugarg-nv
gaugarg-nv approved these changes on 2026-08-10
ORippler
praneshgo
ORippler
ORippler requested changes on 2026-08-18
ORippler
praneshgo
praneshgo praneshgo requested a review from ORippler ORippler 9 days ago
ORippler
ORippler requested changes on 2026-08-19
praneshgo Reverting an unnecessary conditional
614d5244
praneshgo praneshgo requested a review from ORippler ORippler 8 days ago
ORippler
ORippler approved these changes on 2026-08-19
ORippler Update ggml/src/ggml-cuda/mmvq.cu
41a70d7e
gaugarg-nv
gaugarg-nv approved these changes on 2026-08-20
ORippler ORippler merged 2b562109 into master 7 days ago
GenerelSchwerz

Login to write a write a comment.

Login via GitHub

Reviewers
Assignees
No one assigned
Labels
Milestone