onnxruntime
[CUDA] Speed up 8-bit MatMulNBits dequantization with byte permutes
#31350
Merged

[CUDA] Speed up 8-bit MatMulNBits dequantization with byte permutes #31350

tianleiwu
tianleiwu [CUDA] Speed up 8-bit MatMulNBits dequantization with byte permutes
972f27c1
tianleiwu tianleiwu requested a review from copilot-pull-request-reviewer copilot-pull-request-reviewer 7 days ago
tianleiwu tianleiwu requested a review from jambayk jambayk 7 days ago
copilot-pull-request-reviewer
copilot-pull-request-reviewer commented on 2026-08-01
tianleiwu [CUDA] Use safe bit casts in 8-bit dequantization
0405b748
tianleiwu tianleiwu enabled auto-merge (squash) 7 days ago
tianleiwu tianleiwu requested a review from apsonawane apsonawane 6 days ago
tianleiwu tianleiwu requested a review from nenad1002 nenad1002 6 days ago
tianleiwu tianleiwu requested a review from titaiwangms titaiwangms 6 days ago
titaiwangms
titaiwangms approved these changes on 2026-08-03
tianleiwu tianleiwu merged 5b249f65 into main 4 days ago
tianleiwu tianleiwu deleted the tlwu/20260801/matmul_8bits_fast_dequant branch 4 days ago

Login to write a write a comment.

Login via GitHub

Assignees
No one assigned
Labels
Milestone