llama.cpp
b74f590e
- ggml-cuda: fix divergent barrier in f16 flash attention (#27870)
Go
Login via GitHub
Home
Pricing
FAQ
Install
Login
via GitHub
Commit
View On
GitHub
Commit
5 days ago
ggml-cuda: fix divergent barrier in f16 flash attention (#27870) * ggml-cuda: fix divergent barrier in f16 flash attention * ggml-cuda: avoid duplicate metadata pointer setup
References
#27870 - ggml-cuda: fix divergent barrier in f16 flash attention
Author
siavashnorouzi
Parents
992cb503
Loading