O projeto llama.cpp lançou a compilação b11368, que introduz amostragem probabilística para fluxos de trabalho de rascunho simples e MTP (Multi-Token Prediction). Esta atualização modifica o mecanismo de rascunho para usar seleção probabilística enquanto verifica os alvos por meio de amostragem por rejeição.

  • O gerador de rascunhos agora usa amostragem probabilística, com verificação de alvos tratada por amostragem por rejeição.
  • Buffers spec_draft_q obsoletos são descartados antes do início do processo de rascunho.
  • Solicitações restritas por gramática agora suportam amostragem por rejeição e fallback para amostragem argmax.
  • Uma nova flag habilita a amostragem probabilística de rascunho, com comportamento padrão greedy.
  • O sampler de rascunhos não compartilha mais o fluxo RNG do alvo, e as distribuições são renormalizadas após a máscara.

Este lançamento fornece binários para macOS, Linux, Windows, Android e openEuler através de vários backends de hardware incluindo CUDA, ROCm, Vulkan, OpenVINO e SYCL.