El proyecto llama.cpp lanzó la versión b10355, introduciendo soporte para el muestreo de backend con salida múltiple. Esta actualización permite combinar el muestreo de backend con la especulación de tokens y añade un parámetro de contexto numérico para declarar el máximo de salidas por secuencia.

  • Habilitar el muestreo de backend con especulación de tokens
  • Acotar la suma de la máscara antes de convertirla en el índice muestreado
  • Añadir un parámetro de contexto numérico que declare las salidas máximas por una secuencia
  • Corregir las discrepancias entre el muestreo de CPU y backend, y igualar la distribución (dist) entre CPU y GPU
  • Simplificar los cambios y corregir las pruebas en Vulkan

El lanzamiento proporciona binarios para macOS, iOS, Linux, Android, Windows y openEuler a través de varios backends de hardware incluyendo CPU, CUDA, ROCm, OpenVINO, SYCL, HIP y Vulkan.