llama.cpp
031ddb2e
- llama: use f16 mask for FA to save VRAM (#23764)
Go
Login via GitHub
Home
Pricing
FAQ
Install
Login
via GitHub
Commit
View On
GitHub
Commit
57 days ago
llama: use f16 mask for FA to save VRAM (#23764) * llama: use f16 mask for FA * review: add llama_cast + formatting * simplify
References
#23764 - llama: use f16 mask for FA to save VRAM
Author
am17an
Parents
fe12e422
Loading