CUDA: size routed MoE MMQ N-tiles from typical expert width on RDNA3 (recreated) #28552
CUDA: size routed MoE MMQ N-tiles from typical expert width on RDNA3 …
79800853
CUDA: pick MMQ tile size against ncols_opt set on the host side
f01a7549
pwilkin
requested a review
1 day ago
Login to write a write a comment.
Login via GitHub