llama.cpp
CUDA: Improve NVFP4 W4A4 activation quantization
#25730
Merged

Commits
  • Squash history before conflict-resolution during rebase on master
    ORippler committed 48 days ago
  • compiler massaging to avoid unnecessary LDCs
    ORippler committed 47 days ago
  • kvalues_mxfp4 -> kvalues_nvfp4 in quantize_mmq_nvfp4
    ORippler committed 42 days ago
  • Always pass in src1_scale.ptr
    ORippler committed 42 days ago
  • Extract ggml_cuda_is_aligned helper
    ORippler committed 42 days ago
Loading