llama.cpp
0324696b
- fit : count nextn (MTP) blocks in n_gpu_layers so front layers stay on GPU (#26177)
Go
Login via GitHub
Home
Pricing
FAQ
Install
Login
via GitHub
Commit
View On
GitHub
Commit
10 days ago
fit : count nextn (MTP) blocks in n_gpu_layers so front layers stay on GPU (#26177)
References
#26177 - mtp nextn offload
Author
John-194
Parents
8e8681e0
Loading