Laboratorio · Hugging Face
github llama.cpp · hace 4 h · 2 vistas

llama.cpp v0.5.0 añade soporte para HRM-Text, aceleración de conv2d en CUDA y enlace a múltiples direcciones

El proyecto llama.cpp ha lanzado la versión 0.5.0, centrada en el rendimiento del backend, una mayor cobertura de modelos y un funcionamiento del servidor más robusto. Esta actualización introduce soporte para nuevas arquitecturas como HRM-Text (DFM Mimir 1B) y MiMo-V2.6, mientras mejora significativamente la eficiencia computacional mediante optimizaciones de CUDA y Metal.

github llama.cpp · hace 1 d · 11 vistas

llama.cpp añade soporte para DFlash en HunyuanOCR y corrige la conversión de borrador

El proyecto llama.cpp ha añadido soporte para la decodificación especulativa DFlash con el modelo HunyuanOCR, exponiendo los tensores de entrada de las capas en el grafo objetivo. Este cambio permite que el modelo de borrador lea los flujos residuales, lo que posibilita que las solicitudes de imagen se ejecuten correctamente con una tasa de aceptación del borrador de aproximadamente 0.5 y una salida OCR idéntica a nivel de bytes en comparación con las ejecuciones no especulativas.

lab Hugging Face Blog · hace 2 d · 10 vistas

tokenizers v1 release candidate ofrece codificación 3-30x más rápida mediante división de bitstream y caché

La biblioteca tokenizers ha lanzado una versión candidata a release 1 que mejora significativamente el rendimiento para la codificación de texto, abordando cuellos de botella en los flujos de trabajo de entrenamiento y servicio. La actualización mantiene compatibilidad con la API de v0.23 mientras proporciona aceleraciones sustanciales en diez familias de modelos.