El proyecto llama.cpp ha lanzado la versión 0.5.0, centrada en el rendimiento del backend, una mayor cobertura de modelos y un funcionamiento del servidor más robusto. Esta actualización introduce soporte para nuevas arquitecturas como HRM-Text (DFM Mimir 1B) y MiMo-V2.6, mientras mejora significativamente la eficiencia computacional mediante optimizaciones de CUDA y Metal.

  • Acelera las operaciones conv2d en CUDA utilizando GEMM implícito.
  • Añade fusiones de optimización para Metal MoE y SSM_CONV.
  • Permite que el servidor se enlace a múltiples direcciones mediante direcciones TCP separadas por comas y sockets UNIX.
  • Habilita salidas de imagen desde llamadas a funciones añadiendo soporte para input_image.
  • Actualiza ggml a v0.25.0, expandiendo el soporte de hiper-conexión y flash-attention en los backends.

El lanzamiento mejora la estabilidad para los procesos hijos generados por el enrutador y corrige varios problemas del analizador de chat, asegurando un funcionamiento más fiable para usuarios que despliegan llama.cpp en entornos de producción.