El proyecto llama.cpp ha lanzado la versión b10199, introduciendo nuevas capacidades en su componente de servidor. La actualización principal permite al servidor soportar incrustaciones para generar el siguiente token, añadiendo específicamente soporte para incrustaciones de tokens muestreados.

  • El servidor ahora soporta la generación de incrustaciones para tokens muestreados para facilitar flujos de trabajo de predicción del siguiente token.
  • Se aplicó una corrección al destructor ~server_batch().
  • Las compilaciones de macOS Apple Silicon (arm64) con KleidiAI están deshabilitadas en esta versión.
  • Los binarios precompilados están disponibles para Linux, Windows, Android y macOS a través de los backends CPU, CUDA, Vulkan, ROCm, OpenVINO, SYCL y OpenCL.

Esta actualización permite a los usuarios que aprovechan el servidor llama.cpp acceder directamente a las incrustaciones de tokens durante la generación, lo cual es útil para aplicaciones que requieren representaciones vectoriales de los tokens de salida.