Le projet llama.cpp a publié la version b11157, introduisant le support des opérations de convolution 3D utilisant le GEMM implicite sur CUDA. Cette mise à jour affine l'implémentation pour gérer les noyaux vides et est disponible sur une large gamme de plateformes incluant macOS, Linux, Windows, Android et iOS.

  • Ajoute conv3d avec GEMM implicite pour les backends CUDA.
  • Affine la logique du GEMM implicite de conv3d pour gérer correctement les noyaux vides.
  • Fournit des binaires pour CPU, Vulkan, ROCm, OpenVINO, SYCL et Snapdragon sur Linux et Windows.
  • Inclut des builds pour macOS Apple Silicon (arm64), macOS Intel (x64) et iOS XCFramework.
  • Propose des builds Android arm64 avec support pour CPU, GPU Adreno et NPU Hexagon.

Cette version étend les capacités d'accélération matérielle de la bibliothèque en activant les opérations de convolution 3D sur les GPU NVIDIA.