llama.cpp
ggml : add Q8_0 quantization format (rename the old one to Q8_1) (ARM NEON)
#1179
Merged

ggml : add Q8_0 quantization format (rename the old one to Q8_1) (ARM NEON) #1179

ggerganov merged 10 commits into master from q8_0
ggerganov
ggerganov ggml : add Q8_0 quantization format (rename the old one to Q8_1)
f83c321c
ggerganov tests : fix test-quantize-fns
79cfdf5e
sw
ggerganov ggml : finalize Q8_0 implementation
d8bf7207
ggerganov ggml : use q4_0_q8_0 and q4_2_q8_0
6496b79e
ggerganov
ggerganov ggml : fix Q8_0 dot product bug (ARM)
88618ab7
ggerganov ggml : Q8_0 unroll x2
6e0f0b6f
ggerganov ggerganov added generation quality
ggerganov ggerganov assigned ggerganov ggerganov 3 years ago
sw
ggerganov ggml : fix bug - using wrong block type
46fc696d
ggerganov ggerganov force pushed to 46fc696d 3 years ago
ggerganov ggml : extend quantize_fns_t with "vec_dot_type"
91bfa51d
ggerganov
sw
sw commented on 2023-04-25
ggerganov ggml : fix Q8_0 to use 255 values out of 256
4ddb983a
sw
sw commented on 2023-04-25
ggerganov ggml : fix assert using wrong QK4_2 instead of QK4_3
e8c37317
sw
ggerganov
ggerganov ggerganov merged 7a32fcb3 into master 3 years ago
ggerganov ggerganov deleted the q8_0 branch 3 years ago
mofosyne mofosyne added Tensor Encoding Scheme
mofosyne mofosyne added Review Complexity : High

Login to write a write a comment.

Login via GitHub

Reviewers
Assignees
Labels
Milestone