llama.cpp
cuda : add batched cuBLAS GEMM for faster attention
#3749
Merged
Go
Login via GitHub
Home
Pricing
FAQ
Install
Login
via GitHub
Overview
Commits
10
Changes
View On
GitHub
Commits
cmake : add helper for faster CUDA builds
ggerganov
committed
2 years ago
batched : add NGL arg
ggerganov
committed
2 years ago
ggml : skip nops in compute_forward
ggerganov
committed
2 years ago
cuda : minor indentation
ggerganov
committed
2 years ago
cuda : batched cuBLAS GEMMs for src0 F16 and src1 F32 (attention ops)
ggerganov
committed
2 years ago
Apply suggestions from code review
KerfuffleV2
committed
2 years ago
cuda : add ROCm / hipBLAS cublasGemmBatchedEx define
ggerganov
committed
2 years ago
cuda : add cublasGemmStridedBatchedEx for non-broadcasted cases
ggerganov
committed
2 years ago
cuda : reduce mallocs in cublasGemmBatchedEx branch
ggerganov
committed
2 years ago
cuda : add TODO for calling cublas from kernel + using mem pool
ggerganov
committed
2 years ago
Loading