O llama.cpp versão 0.4.0 introduz suporte de arquitetura inicial para os modelos Qwen3.8-Flash-Next e NVIDIA Nemotron-3-Puzzle-75B-A9B, juntamente com uma atualização da biblioteca subjacente ggml para a versão 0.23.0.
- Adicionado leitura preguiçosa de tensores sob demanda e limites de contexto do servidor por slot.
- Atualizado ggml para 0.23.0 com atenção flash esparsa e suporte ao transporte Apple RDMA.
- Introduzidas opções de entrada de vídeo, busca de histórico n-gramas e limites de RAM para o quantizador.
- Habilitado `preserve_reasoning` por padrão no servidor e melhorados os auxiliares de tokenização multimodal.
Essas alterações expandem a compatibilidade do modelo e fornecem aos desenvolvedores um controle mais fino sobre o uso de memória e alocação de recursos do servidor.