Pasha Khosravi and Georgi Gerganov
66e178ec84
Add Q2_0 quantization: type definition and CPU backend (llama/24448)
2026-07-10 13:06:42 +03:00
c6d1fbf31f
cuda: Q1_0 initial backend (llama/21629)
...
* [cuda] initial Q1_0 backend
* remove unused code, fix AMD MMA guard
* attempt to support dp4a
* Apply suggestions from code review
Co-authored-by: Johannes Gäßler <johannesg@5d6.de >
---------
Co-authored-by: Johannes Gäßler <johannesg@5d6.de >
2026-04-30 11:29:10 +03:00
Pasha Khosravi and Georgi Gerganov
15deafa31e
metal: Q1_0 backend (llama/21528)
...
* initial Q1_0 Metal backend
* tuning q1_0 metal kernels
* add Q1_0 to test-backend-ops
* add Q1_0<->F32 copy test
* Apply suggestions from code review
Co-authored-by: Georgi Gerganov <ggerganov@gmail.com >
---------
Co-authored-by: Georgi Gerganov <ggerganov@gmail.com >
2026-04-30 11:29:03 +03:00
0c2fbd4703
ggml: add Q1_0 1-bit quantization support (CPU) (llama/21273)
...
* ggml: add Q1_0 and Q1_0_g128 1-bit quantization support (CPU)
* add generic fallback for x86
* remove Q1_0 (group size 32)
* rename Q1_0_g128 => Q1_0
* fix Q1_0 LlamaFileType Enum
* Fix trailing spaces; add generic fallback for othre backends
* Apply suggestions from code review
Co-authored-by: Sigbjørn Skjæret <sigbjorn.skjaeret@scala.com >
* fix /r/n spacing + arch-fallback
---------
Co-authored-by: Sigbjørn Skjæret <sigbjorn.skjaeret@scala.com >
2026-04-30 11:29:01 +03:00