O projeto llama.cpp lançou a versão b11132, introduzindo suporte ao backbone de rascunho Gemma 4 DSpark. Esta atualização habilita a conversão GGUF e capacidades em tempo de execução para rascunhos Gemma 4 com atenção completa e SWA, incluindo pesos de saída vinculados e metadados do backbone booleanos.
- Adicionado suporte dspark para modelos de rascunho Gemma 4 com variantes de atenção completa e SWA.
- Implementada a inferência de características de rascunho Gemma a partir de metadados via mecanismo dflash.
- Lançados binários para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, CUDA, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, OpenCL, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android e iOS.
Este lançamento permite que os usuários utilizem modelos Gemma 4 dentro do ecossistema llama.cpp em uma ampla gama de plataformas de hardware.