llama.cpp
07a19e27 - CUDA: fix quantized KV cache + multiple sequences (#14822)

Commit

319 days ago

CUDA: fix quantized KV cache + multiple sequences (#14822) * CUDA: fix quantized KV cache + multiple sequences * Update ggml/src/ggml-cuda/fattn-common.cuh Co-authored-by: Georgi Gerganov <ggerganov@gmail.com> --------- Co-authored-by: Georgi Gerganov <ggerganov@gmail.com>

References

#14756 - tests : add non-cont K,V FA tests

Author

JohannesGaessler

Committer

ggerganov

Parents

18f3b5ff

llama.cpp 07a19e27 - CUDA: fix quantized KV cache + multiple sequences (#14822)

llama.cpp
07a19e27 - CUDA: fix quantized KV cache + multiple sequences (#14822)