ggml-org/llama.cpp b8064 on GitHub

Details

cuda: optimize iq2xxs/iq2xs/iq3xxs dequantization (#19624)

express (sum * scale + sum / 2) / 4 as (sum * (scale * 2 + 1)) / 8
express ((aux32 >> 28) * 2 + 1) as (aux32 >> 27 | 1)

saves 3 registers for mul_mat_vec_q (152 -> 149) according to nsight
AFAICT no overflow can occur here as iq2xxs values are far too small

error: identifier "uint" is undefined

macOS/iOS:

Linux:

Windows:

openEuler: