Tema · Local inference
lab Hugging Face Blog · hace 8 h · 3 vistas

Hugging Face lanza 207 núcleos WebGPU y una herramienta de evaluación en el navegador

Hugging Face ha lanzado @huggingface/kernels, una biblioteca para cargar y ejecutar núcleos WebGPU optimizados desde el Hub de Hugging Face, junto con una colección inicial de 207 núcleos. El lanzamiento también introduce Fleet, un conjunto de evaluación de GPU en el navegador que recopila evidencia de rendimiento y corrección de los dispositivos de los usuarios.

github llama.cpp · hace 2 d · 11 vistas

llama.cpp b10707 optimiza el escaneo de celdas del caché KV para una generación más rápida

El proyecto llama.cpp lanzó la versión b10707, que incluye una optimización de rendimiento en el manejo del caché de clave-valor (KV). La actualización modifica la función `for_each_token_in` para detener el escaneo una vez que se han visto todas las secuencias dentro de una celda específica, en lugar de iterar por todas las secuencias máximas posibles.

github llama.cpp · hace 5 d · 7 vistas

llama.cpp b10666 corrige las pruebas de guardado/carga de estado y la copia de secuencias en el dispositivo

La versión b10666 de llama.cpp amplía el conjunto de pruebas de guardado/carga de estado para ejecutarse en todas las arquitecturas y resuelve varios errores críticos en la gestión del estado y el manejo del grafo. Los cambios clave incluyen corregir referencias colgantes en minimax-01, alinear la copia de fragmentos para secuencias en el dispositivo y corregir los conteos de cabezales del indexador para deepseek4.