github ggml-org/llama.cpp b11331

latest releases: b11333, b11332
pre-release2 hours ago
Details

CUDA: Handle compute type for NVFP4 on cublass path (#29173)

  • CUDA: Handle compute type for NVFP4 on cublass path

Signed-off-by: ynankani ynankani@nvidia.com

  • Use BF16 compute type for quantized models if HW allows

Signed-off-by: ynankani ynankani@nvidia.com

  • Set acc prec to bf16 for nvfp4 as it needs atleast bf16 range

Signed-off-by: ynankani ynankani@nvidia.com

  • Update ggml/src/ggml-cuda/ggml-cuda.cu

Co-authored-by: Johannes Gäßler johannesg@5d6.de

  • preserve op_params for per-expert matmul

Signed-off-by: ynankani ynankani@nvidia.com


Signed-off-by: ynankani ynankani@nvidia.com
Co-authored-by: Johannes Gäßler johannesg@5d6.de

Website:

Attestations:

macOS/iOS:

Linux:

Android:

Windows:

openEuler:

  • DISABLED
  • openEuler x86 (310p)
  • openEuler x86 (910b, ACL Graph)
  • openEuler aarch64 (310p)
  • openEuler aarch64 (910b, ACL Graph)

UI:

Don't miss a new llama.cpp release

NewReleases is sending notifications on new releases.