llama.cpp
eeae28b6 - ggml-cpu/ops: vectorize flash-attention V-cache F16 to F32 conversion (#26947)

Commit
2 days ago
ggml-cpu/ops: vectorize flash-attention V-cache F16 to F32 conversion (#26947) Co-authored-by: jinzihao <jinzihao.jzh@alibaba-inc.com>
Author
Parents
Loading