O projeto llama.cpp lançou a compilação b10273, abordando um problema crítico onde os amostradores baseados em histórico não podiam inferir o comprimento correto do contexto durante a inicialização devido a restrições do backend de amostragem.
- Corrige -1 para 1024 em vez de ctx-len para os amostradores para corrigir erros de inicialização.
- Define um padrão compartilhado de 64 para os amostradores baseados em histórico e remove o parâmetro context_size.
- Fornece binários para macOS, Linux, Windows, Android e openEuler através de CPU, GPU (CUDA, Vulkan, ROCm, SYCL) e backends OpenVINO.
Esta atualização garante um comportamento estável do amostrador durante as fases iniciais de construção quando o llama_context completo ainda não está disponível.