llama.cpp
b74f590e - ggml-cuda: fix divergent barrier in f16 flash attention (#27870)

Commit
5 days ago
ggml-cuda: fix divergent barrier in f16 flash attention (#27870) * ggml-cuda: fix divergent barrier in f16 flash attention * ggml-cuda: avoid duplicate metadata pointer setup
Parents
Loading