Optimize CUDA DynamicSparseAttention for large-context inference #32671
kunal-vaishnavi
changed the base branch from
main
to
copilot/copilotadd-cuda-dynamicsparseattention
2 days ago
Parallelize CUDA DynamicSparseAttention
cc469b31
Harden fused attention synchronization
f7e31683
Scale DynamicSparseAttention to large contexts
9db25a2e
Reduce large-context attention workspace
f4fde1bc
Bound sparse attention split workspace
0baf5060
Bound DynamicSparseAttention split work
e9c1dd69
Make DSA device validation opt-in
a755df8a
Test default DSA validation mode
2778f193
Login to write a write a comment.
Login via GitHub