El proyecto llama.cpp lanzó la versión b10355, introduciendo soporte para el muestreo de backend con salida múltiple. Esta actualización permite combinar el muestreo de backend con la especulación de tokens y añade un parámetro de contexto numérico para declarar el máximo de salidas por secuencia.
- Habilitar el muestreo de backend con especulación de tokens
- Acotar la suma de la máscara antes de convertirla en el índice muestreado
- Añadir un parámetro de contexto numérico que declare las salidas máximas por una secuencia
- Corregir las discrepancias entre el muestreo de CPU y backend, y igualar la distribución (dist) entre CPU y GPU
- Simplificar los cambios y corregir las pruebas en Vulkan
El lanzamiento proporciona binarios para macOS, iOS, Linux, Android, Windows y openEuler a través de varios backends de hardware incluyendo CPU, CUDA, ROCm, OpenVINO, SYCL, HIP y Vulkan.