O projeto llama.cpp lançou a versão b10199, introduzindo novas capacidades em seu componente de servidor. A atualização principal permite que o servidor suporte embeddings para gerar o próximo token, especificamente adicionando suporte para embeddings de tokens amostrados.
- O servidor agora suporta geração de embedding para tokens amostrados para facilitar fluxos de trabalho de previsão do próximo token.
- Uma correção foi aplicada ao destrutor ~server_batch().
- As compilações do macOS Apple Silicon (arm64) com KleidiAI estão desabilitadas nesta versão.
- Binários pré-compilados estão disponíveis para Linux, Windows, Android e macOS através dos backends CPU, CUDA, Vulkan, ROCm, OpenVINO, SYCL e OpenCL.
Esta atualização permite que usuários que utilizam o servidor llama.cpp acessem embeddings de tokens diretamente durante a geração, o que é útil para aplicações que requerem representações vetoriais dos tokens de saída.