llama.cpp versión b9741 introduce nuevos binarios para macOS, Linux, Android, Windows y openEuler en múltiples arquitecturas. El lanzamiento incluye soporte para Vulkan, CUDA 12.4 y 13.3, OpenVINO, SYCL y ROCm, con versiones actualizadas para iOS y Ubuntu.
llama.cpp Release b9741 Añade Nuevos Binarios y Soporte
ggml optimiza AMX con aplanamiento de particiones
El proyecto ggml ha optimizado el rendimiento de AMX aplanando la partición sobre n_batch * M, asegurando que todos los hilos participen en la cuantización. Este cambio mejora la velocidad hasta 1.47x en diversos modelos y configuraciones de hardware en plataformas de CPU y GPU, con resultados que muestran ganancias consistentes en el tiempo de inferencia.
ggml-webgpu añade interruptores de adaptador F16 para Vulkan y NVIDIA
El proyecto ggml-webgpu ha añadido interruptores de adaptador para el soporte de precisión media (F16) en GPUs Vulkan y NVIDIA. Esta actualización permite un mejor rendimiento en hardware compatible a través de múltiples plataformas, incluyendo macOS, Linux, Android, Windows y openEuler, con compilaciones específicas disponibles para las arquitecturas ARM y x64.
LLaMA.cpp lanza b9729: nuevos binarios y soporte de plataformas
LLaMA.cpp publica la versión b9729 con binarios para macOS, Linux, Android, Windows y openEuler en múltiples arquitecturas. La publicación incluye soporte para CPU, Vulkan, OpenVINO, SYCL y ROCm, junto con un nuevo paquete de interfaz de usuario. Se han eliminado las referencias internas a 'webui'.
llama.cpp Release b9703: Actualizaciones y descargas de binarios
La versión b9703 de llama.cpp incluye una reestructuración del manejo de presets del servidor, eliminando el soporte para presets remotos de HF y funciones obsoletas. El lanzamiento proporciona binarios para macOS, Linux, Android, Windows y openEuler en múltiples arquitecturas y opciones de aceleración por hardware, incluyendo Vulkan, CUDA, OpenVINO y SYCL.
El backend Metal añade soporte para f16 y bf16 al operador de concatenación
El backend Metal en llama.cpp se ha ampliado para admitir los tipos de tensor f16 y bf16 para el operador de concatenación, además del soporte existente para f32 e i32. Esta actualización incluye plantillas de kernel especializadas, obtenedores de canalización actualizados y un despacho de kernel basado en tipos mejorado, con la asistencia de pi:llama.cpp/Qwen3.6-27B.