Local inference
github llama.cpp · hace 17 h · 9 vistas

llama.cpp añade soporte para DFlash en HunyuanOCR y corrige la conversión de borrador

El proyecto llama.cpp ha añadido soporte para la decodificación especulativa DFlash con el modelo HunyuanOCR, exponiendo los tensores de entrada de las capas en el grafo objetivo. Este cambio permite que el modelo de borrador lea los flujos residuales, lo que posibilita que las solicitudes de imagen se ejecuten correctamente con una tasa de aceptación del borrador de aproximadamente 0.5 y una salida OCR idéntica a nivel de bytes en comparación con las ejecuciones no especulativas.

media Hugging Face Forums · hace 1 d · 11 vistas

Usuario busca flujo de trabajo para ablatar Llama-Krikri-8B-Instruct para uso local en griego

Un usuario está planeando construir un modelo de lenguaje grande sin censura y nativo en griego para implementación local utilizando el checkpoint ilsp/Llama-Krikri-8B-Instruct. El plan propuesto implica ablatar el modelo con Heretic (heretic-llm), convertirlo al formato GGUF Q4_K_M y ejecutar inferencia en un GMKtec EVO-X3 equipado con un procesador AMD Ryzen AI MAX+ 395 a través de Vulkan.