llama.cpp v0.5.0 añade soporte para HRM-Text, aceleración de conv2d en CUDA y enlace a múltiples direcciones
El proyecto llama.cpp ha lanzado la versión 0.5.0, centrada en el rendimiento del backend, una mayor cobertura de modelos y un funcionamiento del servidor más robusto. Esta actualización introduce soporte para nuevas arquitecturas como HRM-Text (DFM Mimir 1B) y MiMo-V2.6, mientras mejora significativamente la eficiencia computacional mediante optimizaciones de CUDA y Metal.