llama.cpp
eeae28b6
- ggml-cpu/ops: vectorize flash-attention V-cache F16 to F32 conversion (#26947)
Go
Login via GitHub
Home
Pricing
FAQ
Install
Login
via GitHub
Commit
View On
GitHub
Commit
2 days ago
ggml-cpu/ops: vectorize flash-attention V-cache F16 to F32 conversion (#26947) Co-authored-by: jinzihao <jinzihao.jzh@alibaba-inc.com>
References
#26947 - ggml-cpu/ops: vectorize flash-attention V-cache F16 to F32 conversion
Author
jinzihao
Parents
154d57af
Loading