O projeto llama.cpp lançou a compilação b10148, abordando problemas com a configuração de decodificação especulativa e registro. A atualização garante que argumentos explícitos de linha de comando para modelos rascunho tenham precedência sobre a resolução automática do sidecar.

  • As flags --model-draft explícitas agora desabilitam a resolução automática do sidecar, permitindo que a configuração manual da CLI substitua o comportamento padrão.
  • A lógica de seleção do sidecar foi atualizada para ancorar na tag do modelo principal, habilitando correspondências exatas ou fallbacks para quantização mais próxima.
  • Os logs de carregamento especulativo foram promovidos de trace para info, tornando a visibilidade do contexto do modelo rascunho e MTP consistente com outros logs do sistema.

Essas alterações melhoram a confiabilidade para usuários que dependem de especificações manuais de modelos rascunho e fornecem logs operacionais mais claros.