El proyecto llama.cpp ha lanzado la versión b11205, que introduce una actualización específica en su backend CUDA. Esta versión añade soporte para el tamaño de estado Puzzle de 96 de Nemotron 3 dentro de la implementación del escaneo SSM.

  • La actualización permite manejar modelos Nemotron 3 con un tamaño de estado puzzle de 96 en hardware CUDA.
  • Se proporcionan binarios para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, CUDA, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android e iOS.
  • El lanzamiento incluye binarios de UI estándar junto con los ejecutables específicos de la plataforma.

Esta actualización permite a los usuarios ejecutar modelos Nemotron 3 con tamaños de estado específicos en GPUs NVIDIA compatibles utilizando llama.cpp.