O projeto llama.cpp lançou a compilação b10148, abordando problemas com a configuração de decodificação especulativa e registro. A atualização garante que argumentos explícitos de linha de comando para modelos rascunho tenham precedência sobre a resolução automática do sidecar.
- As flags --model-draft explícitas agora desabilitam a resolução automática do sidecar, permitindo que a configuração manual da CLI substitua o comportamento padrão.
- A lógica de seleção do sidecar foi atualizada para ancorar na tag do modelo principal, habilitando correspondências exatas ou fallbacks para quantização mais próxima.
- Os logs de carregamento especulativo foram promovidos de trace para info, tornando a visibilidade do contexto do modelo rascunho e MTP consistente com outros logs do sistema.
Essas alterações melhoram a confiabilidade para usuários que dependem de especificações manuais de modelos rascunho e fornecem logs operacionais mais claros.