llama.cpp
ggml-webgpu: FlashAttention refactor + standardize quantization support
#23834
Merged
Go
Login via GitHub
Home
Pricing
FAQ
Install
Login
via GitHub
Overview
Commits
9
Changes
View On
GitHub
ggml-webgpu: FlashAttention refactor + standardize quantization support
#23834
ggerganov
merged 9 commits into
ggml-org:master
from
reeselevine:flash_attn_refactor
Start work on flash_attn refactor
e1a0bb34
Refactor
8d61b5cd
Split k/v quantization
19f150a5
Refactor and abstract quantization logic for flash_attn and mul_mat
94a1fdde
Add quantization support to tile path
ddedf2fc
formatting
ffbd86f0
github-actions
added
ggml
github-actions
added
WebGPU
Merge remote-tracking branch 'origin/master' into flash_attn_refactor
2e1d2b5c
Merge remote-tracking branch 'upstream/master' into flash_attn_refactor
e0868e34
reeselevine
marked this pull request as ready for review
111 days ago
reeselevine
requested a review
111 days ago
yomaytk
commented on 2026-06-02
yomaytk
commented on 2026-06-02
yomaytk
commented on 2026-06-02
Move to functions, add a check
cf66f0a3
reeselevine
requested a review
from
ggerganov
110 days ago
github-actions
added
testing
yomaytk
approved these changes on 2026-06-03
reeselevine
added
merge ready
ggerganov
merged
e8c54893
into master
109 days ago
Login to write a write a comment.
Login via GitHub
Reviewers
yomaytk
ggerganov
Assignees
No one assigned
Labels
testing
ggml
merge ready
WebGPU
Milestone
No milestone
Login to write a write a comment.
Login via GitHub