github ggml-org/llama.cpp b10517

one hour ago
Details

vulkan : dequant q8_0 KV once in coopmat1 (#25494)

  • vulkan : dequant q8_0 KV once in coopmat1

Assisted-by: Claude (Opus 4.8)

  • vulkan : fall back instead of aborting when FA scratch exceeds maxStorageBufferRange

  • vulkan : require KV-cache layout in FA dequant path

Assisted-by: Claude (Opus 4.8)

  • vulkan : skip FA dequant path on coopmat2

Assisted-by: Claude (Opus 4.8)

  • tests : add contiguously-allocated quant K/V FA tests

Assisted-by: Claude (Opus 4.8)

  • vulkan : trim comments

  • vulkan : tighten permutation checks for FA path

  • vulkan : set prealloc_x_need_sync after the FA dispatch

  • vulkan : exclude Intel Xe1 from FA dequant path

Website:

Attestations:

macOS/iOS:

Linux:

Android:

Windows:

openEuler:

  • DISABLED
  • openEuler x86 (310p)
  • openEuler x86 (910b, ACL Graph)
  • openEuler aarch64 (310p)
  • openEuler aarch64 (910b, ACL Graph)

UI:

Don't miss a new llama.cpp release

NewReleases is sending notifications on new releases.