github ggml-org/llama.cpp b10069

latest release: b10075
20 hours ago
Details

opencl: Support broadcast for Adreno MUL_MAT and honor view_offs for Adreno Q8_0 MUL_MAT for llama-server multi-stream (#25910)

  • opencl: handle broadcast for adreno gemm/gemv_noshuffle

  • opencl: honor view_offs for adreno noshuffle gemm/gemv

  • opencl: general GEMM/GEMV support broadcast

  • opencl: remove unnecessary tests

  • opencl: remove unnecessary comments


Co-authored-by: Li He lih@qti.qualcomm.com

Website:

macOS/iOS:

Linux:

Android:

Windows:

openEuler:

  • DISABLED
  • openEuler x86 (310p)
  • openEuler x86 (910b, ACL Graph)
  • openEuler aarch64 (310p)
  • openEuler aarch64 (910b, ACL Graph)

UI:

Don't miss a new llama.cpp release

NewReleases is sending notifications on new releases.