O projeto llama.cpp lançou a versão b11157, introduzindo suporte para operações de convolução 3D usando GEMM implícito no CUDA. Esta atualização refina a implementação para lidar com kernels vazios e está disponível em uma ampla gama de plataformas, incluindo macOS, Linux, Windows, Android e iOS.

  • Adiciona conv3d com GEMM implícito para backends CUDA.
  • Refina a lógica do GEMM implícito do conv3d para lidar corretamente com kernels vazios.
  • Fornece binários para CPU, Vulkan, ROCm, OpenVINO, SYCL e Snapdragon no Linux e Windows.
  • Inclui builds para macOS Apple Silicon (arm64), macOS Intel (x64) e iOS XCFramework.
  • Oferece builds Android arm64 com suporte para CPU, GPU Adreno e NPU Hexagon.

Este lançamento expande as capacidades de aceleração por hardware da biblioteca ao habilitar operações de convolução 3D em GPUs NVIDIA.