El proyecto llama.cpp ha lanzado la versión 0.5.0, centrada en el rendimiento del backend, una mayor cobertura de modelos y un funcionamiento del servidor más robusto. Esta actualización introduce soporte para nuevas arquitecturas como HRM-Text (DFM Mimir 1B) y MiMo-V2.6, mientras mejora significativamente la eficiencia computacional mediante optimizaciones de CUDA y Metal.
- Acelera las operaciones conv2d en CUDA utilizando GEMM implícito.
- Añade fusiones de optimización para Metal MoE y SSM_CONV.
- Permite que el servidor se enlace a múltiples direcciones mediante direcciones TCP separadas por comas y sockets UNIX.
- Habilita salidas de imagen desde llamadas a funciones añadiendo soporte para input_image.
- Actualiza ggml a v0.25.0, expandiendo el soporte de hiper-conexión y flash-attention en los backends.
El lanzamiento mejora la estabilidad para los procesos hijos generados por el enrutador y corrige varios problemas del analizador de chat, asegurando un funcionamiento más fiable para usuarios que despliegan llama.cpp en entornos de producción.