O projeto llama.cpp lançou a versão b11205, que introduz uma atualização específica em seu backend CUDA. Este lançamento adiciona suporte ao tamanho de estado Puzzle de 96 do Nemotron 3 dentro da implementação de varredura SSM.
- A atualização permite lidar com modelos Nemotron 3 com um tamanho de estado puzzle de 96 em hardware CUDA.
- Binários estão disponíveis para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, CUDA, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android e iOS.
- O lançamento inclui binários de UI padrão junto com os executáveis específicos da plataforma.
Esta atualização permite que os usuários executem modelos Nemotron 3 com tamanhos de estado específicos em GPUs NVIDIA compatíveis usando llama.cpp.