Le projet llama.cpp a publié la version b11205, qui introduit une mise à jour spécifique de son backend CUDA. Cette version ajoute le support de la taille d'état Puzzle de 96 de Nemotron 3 dans l'implémentation du balayage SSM.
- La mise à jour permet de gérer les modèles Nemotron 3 avec une taille d'état puzzle de 96 sur du matériel CUDA.
- Des binaires sont fournis pour macOS (Apple Silicon et Intel), Linux (CPU, Vulkan, CUDA, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android et iOS.
- La version inclut des binaires d'interface utilisateur standard aux côtés des exécutables spécifiques à la plateforme.
Cette mise à jour permet aux utilisateurs d'exécuter des modèles Nemotron 3 avec des tailles d'état spécifiques sur des GPU NVIDIA compatibles en utilisant llama.cpp.