Fuente · llama.cpp
github llama.cpp · hace 4 h · 2 vistas

llama.cpp v0.5.0 añade soporte para HRM-Text, aceleración de conv2d en CUDA y enlace a múltiples direcciones

El proyecto llama.cpp ha lanzado la versión 0.5.0, centrada en el rendimiento del backend, una mayor cobertura de modelos y un funcionamiento del servidor más robusto. Esta actualización introduce soporte para nuevas arquitecturas como HRM-Text (DFM Mimir 1B) y MiMo-V2.6, mientras mejora significativamente la eficiencia computacional mediante optimizaciones de CUDA y Metal.

github llama.cpp · hace 1 d · 11 vistas

llama.cpp añade soporte para DFlash en HunyuanOCR y corrige la conversión de borrador

El proyecto llama.cpp ha añadido soporte para la decodificación especulativa DFlash con el modelo HunyuanOCR, exponiendo los tensores de entrada de las capas en el grafo objetivo. Este cambio permite que el modelo de borrador lea los flujos residuales, lo que posibilita que las solicitudes de imagen se ejecuten correctamente con una tasa de aceptación del borrador de aproximadamente 0.5 y una salida OCR idéntica a nivel de bytes en comparación con las ejecuciones no especulativas.