llama.cpp
vulkan: optimize flash attention split_k_reduce
#14554
Merged
Go
Login via GitHub
Home
Pricing
FAQ
Install
Login
via GitHub
Overview
Commits
2
Changes
View On
GitHub
Commits
vulkan: allow FA split_k with smaller KV values
jeffbolznv
committed
1 year ago
vulkan: spread split_k_reduce work across more threads
jeffbolznv
committed
1 year ago
Loading