llama.cpp
vulkan: optimize flash attention split_k_reduce
#14554
Merged

Commits
  • vulkan: allow FA split_k with smaller KV values
    jeffbolznv committed 1 year ago
  • vulkan: spread split_k_reduce work across more threads
    jeffbolznv committed 1 year ago
Loading