El proyecto llama.cpp ha lanzado la versión b10412, que introduce soporte de muestreo del backend tanto para los backends dflash como dspark. Esta actualización también permite valores p_min mayores que 0 dentro de la lógica de muestreo del backend y añade las salvaguardas correspondientes.

  • Habilita el muestreo del backend para dflash y dspark.
  • Permite p_min > 0 en el muestreo del backend con protecciones añadidas.
  • Proporciona binarios para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, OpenVINO, SYCL), Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android y openEuler.

Esta versión amplía las opciones de aceleración por hardware disponibles para los usuarios de llama.cpp.