O projeto llama.cpp lançou a versão b10355, introduzindo suporte para amostragem de backend com saída múltipla. Esta atualização permite combinar a amostragem de backend com a especulação de tokens e adiciona um parâmetro de contexto numérico para declarar o máximo de saídas por sequência.
- Habilitar a amostragem de backend com especulação de tokens
- Limitar a soma da máscara antes de convertê-la no índice amostrado
- Adicionar um parâmetro de contexto numérico declarando as saídas máximas por uma sequência
- Corrigir incompatibilidades entre a amostragem de CPU e do backend, e igualar a distribuição (dist) entre CPU e GPU
- Simplificar as alterações e corrigir os testes no Vulkan
O lançamento fornece binários para macOS, iOS, Linux, Android, Windows e openEuler através de vários backends de hardware incluindo CPU, CUDA, ROCm, OpenVINO, SYCL, HIP e Vulkan.