llama.cpp 项目发布了 b11157 版本,引入了在 CUDA 上使用隐式 GEMM 进行 3D 卷积操作的支持。此更新改进了实现以处理空内核,并可在 macOS、Linux、Windows、Android 和 iOS 等广泛平台上使用。
- 为 CUDA 后端添加了带有隐式 GEMM 的 conv3d。
- 优化了 conv3d 隐式 GEMM 逻辑以正确处理空内核。
- 提供 Linux 和 Windows 上的 CPU、Vulkan、ROCm、OpenVINO、SYCL 和 Snapdragon 的二进制文件。
- 包括 macOS Apple Silicon (arm64)、macOS Intel (x64) 和 iOS XCFramework 的构建。
- 提供支持 CPU、Adreno GPU 和 Hexagon NPU 的 Android arm64 构建。
此发布通过启用 NVIDIA GPU 上的 3D 卷积操作,扩展了库的硬件加速能力。