O projeto llama.cpp lançou a versão b11440, que inclui uma correção para a inicialização especulativa de MTP. A atualização garante que o agendador seja re-reservado quando as flags de extração NextN mudarem, prevenindo problemas com extração não mascarada.

  • A inicialização especulativa de MTP agora habilita a extração NextN nos contextos de destino e rascunho após a criação.
  • O grafo trunk mantém cada token até a última camada em vez de cortar para as linhas de saída.
  • Invalidar a reserva quando as flags mudam permite que o próximo cálculo re-reserve com a nova forma do grafo.
  • Os binários estão disponíveis para macOS, Linux, Windows, Android e iOS através de backends CPU, GPU e NPU.

Esta mudança previne erros GGML_SCHED_DEBUG_REALLOC garantindo a alocação correta da forma do lote durante a decodificação.