O projeto llama.cpp lançou a compilação b10273, abordando um problema crítico onde os amostradores baseados em histórico não podiam inferir o comprimento correto do contexto durante a inicialização devido a restrições do backend de amostragem.

  • Corrige -1 para 1024 em vez de ctx-len para os amostradores para corrigir erros de inicialização.
  • Define um padrão compartilhado de 64 para os amostradores baseados em histórico e remove o parâmetro context_size.
  • Fornece binários para macOS, Linux, Windows, Android e openEuler através de CPU, GPU (CUDA, Vulkan, ROCm, SYCL) e backends OpenVINO.

Esta atualização garante um comportamento estável do amostrador durante as fases iniciais de construção quando o llama_context completo ainda não está disponível.