llama.cpp
improve CUDA cpy memory bandwidth when copying transposed tensor
#16841
Merged

improve CUDA cpy memory bandwidth when copying transposed tensor #16841

bssrdf
bssrdf WIP
5afac4df
bssrdf added a cpy kernel specific to transposed tensor which uses smem to a…
30d46071
bssrdf bssrdf requested a review from slaren slaren 278 days ago
CISC
bssrdf added BF16 support
d3bdcf84
bssrdf
CISC
github-actions github-actions added testing
github-actions github-actions added Nvidia GPU
github-actions github-actions added ggml
am17an
bssrdf
more strict check to make sure src0 is a transpose
18818a28
am17an
JohannesGaessler
JohannesGaessler commented on 2025-10-30
bssrdf
reformulated to handle more complicated transpose cases
35daa02a
merged ok
29387cee
bring back 2D transpose for higher performance
d2ec251f
allow build on windows
38096455
bssrdf tranpose copy more shapes
c36b70b1
minor tweak
90fd9920
final clean up
d49232c6
JohannesGaessler
bssrdf restore some test cases
8dbb4c7d
bssrdf Merge branch 'cuda-transpose-cpy' of github.com:bssrdf/llama.cpp into…
351cf561
bssrdf
JohannesGaessler
JohannesGaessler commented on 2025-11-03
bssrdf
keep only the kernel for true tranposed case; updated with review sug…
28e5cf6e
bssrdf
make CI happy
1f8e4c0e
JohannesGaessler
JohannesGaessler approved these changes on 2025-11-04
remove headers not needed
e909afd9
reduced bank conflicts for fp16 and bf16
3b8100c7
add missing const*
51a25903
now bank conflicts free
2eb51172
use padding instead of swizzling
bc95e58d
JohannesGaessler
bssrdf
JohannesGaessler JohannesGaessler merged 230d1169 into master 271 days ago
bssrdf bssrdf deleted the cuda-transpose-cpy branch 271 days ago

Login to write a write a comment.

Login via GitHub

Assignees
No one assigned
Labels
Milestone