O projeto llama.cpp lançou a versão 0.5.0, focando em desempenho do backend, cobertura mais ampla de modelos e operação de servidor mais robusta. Esta atualização introduz suporte para novas arquiteturas como HRM-Text (DFM Mimir 1B) e MiMo-V2.6, enquanto melhora significativamente a eficiência computacional por meio de otimizações CUDA e Metal.
- Acelera operações CUDA conv2d usando GEMM implícito.
- Adiciona otimizações de fusão Metal MoE e SSM_CONV.
- Permite que o servidor se vincule a múltiplos endereços por meio de endereços TCP separados por vírgula e soquetes UNIX.
- Habilita saídas de imagem a partir de chamadas de função adicionando suporte a input_image.
- Atualiza ggml para v0.25.0, expandindo o suporte a hiper-conexão e flash-attention em backends.
O lançamento melhora a estabilidade para filhos gerados pelo roteador e corrige vários problemas no parser de chat, garantindo operação mais confiável para usuários que implantam llama.cpp em ambientes de produção.