llama.cpp
4de4f8fc - llama + CUDA: flash_attn_ext_rows (fix unified kv for multi-seq)

Commit
1 day ago
llama + CUDA: flash_attn_ext_rows (fix unified kv for multi-seq)
Author
Committer
Parents
Loading