llama.cpp
4de4f8fc
- llama + CUDA: flash_attn_ext_rows (fix unified kv for multi-seq)
Go
Login via GitHub
Home
Pricing
FAQ
Install
Login
via GitHub
Commit
View On
GitHub
Commit
1 day ago
llama + CUDA: flash_attn_ext_rows (fix unified kv for multi-seq)
References
aman/sparse-unified
#29510 - llama + CUDA: flash_attn_ext_rows (fix unified kv for multi-seq)
Author
am17an
Committer
ggerganov
Parents
1537a0a8
Loading