llama.cpp
031ddb2e - llama: use f16 mask for FA to save VRAM (#23764)

Commit
57 days ago
llama: use f16 mask for FA to save VRAM (#23764) * llama: use f16 mask for FA * review: add llama_cast + formatting * simplify
Author
Parents
Loading