vllm
[SpecDecode] Reduce TP communication for large-vocab draft models speculative decoding
#39419
Merged
Go
Login via GitHub
Home
Pricing
FAQ
Install
Login
via GitHub
Overview
Commits
14
Changes
View On
GitHub
Loading