Details
CUDA: Handle compute type for NVFP4 on cublass path (#29173)
- CUDA: Handle compute type for NVFP4 on cublass path
Signed-off-by: ynankani ynankani@nvidia.com
- Use BF16 compute type for quantized models if HW allows
Signed-off-by: ynankani ynankani@nvidia.com
- Set acc prec to bf16 for nvfp4 as it needs atleast bf16 range
Signed-off-by: ynankani ynankani@nvidia.com
- Update ggml/src/ggml-cuda/ggml-cuda.cu
Co-authored-by: Johannes Gäßler johannesg@5d6.de
- preserve op_params for per-expert matmul
Signed-off-by: ynankani ynankani@nvidia.com
Signed-off-by: ynankani ynankani@nvidia.com
Co-authored-by: Johannes Gäßler johannesg@5d6.de
Website:
Attestations:
macOS/iOS:
- macOS Apple Silicon (arm64)
- macOS Apple Silicon (arm64, KleidiAI enabled) DISABLED
- macOS Intel (x64)
- iOS XCFramework
Linux:
- Ubuntu x64 (CPU)
- Ubuntu arm64 (CPU)
- Ubuntu s390x (CPU)
- Ubuntu x64 (Vulkan)
- Ubuntu arm64 (Vulkan)
- Ubuntu x64 (CUDA 12) - CUDA 12.8 libraries
- Ubuntu x64 (CUDA 13) - CUDA 13.4 libraries
- Ubuntu arm64 (CUDA 13) - CUDA 13.4 libraries
- Ubuntu x64 (ROCm 10.0)
- Ubuntu x64 (OpenVINO)
- Ubuntu x64 (SYCL FP32)
- Ubuntu x64 (SYCL FP16)
- Linux arm64 (Snapdragon: CPU, Adreno GPU, Hexagon NPU) - setup guide
Android:
Windows:
- Windows x64 (CPU)
- Windows arm64 (CPU)
- Windows arm64 (OpenCL Adreno)
- Windows x64 (CUDA 12) - CUDA 12.4 DLLs
- Windows x64 (CUDA 13) - CUDA 13.4 DLLs
- Windows arm64 (CUDA 13) - CUDA 13.4 DLLs
- Windows x64 (Vulkan)
- Windows x64 (OpenVINO)
- Windows x64 (SYCL)
- Windows x64 (ROCm 10.0)
openEuler:
- DISABLED
- openEuler x86 (310p)
- openEuler x86 (910b, ACL Graph)
- openEuler aarch64 (310p)
- openEuler aarch64 (910b, ACL Graph)
UI: