O projeto llama.cpp lançou a compilação b11368, que introduz amostragem probabilística para fluxos de trabalho de rascunho simples e MTP (Multi-Token Prediction). Esta atualização modifica o mecanismo de rascunho para usar seleção probabilística enquanto verifica os alvos por meio de amostragem por rejeição.
- O gerador de rascunhos agora usa amostragem probabilística, com verificação de alvos tratada por amostragem por rejeição.
- Buffers spec_draft_q obsoletos são descartados antes do início do processo de rascunho.
- Solicitações restritas por gramática agora suportam amostragem por rejeição e fallback para amostragem argmax.
- Uma nova flag habilita a amostragem probabilística de rascunho, com comportamento padrão greedy.
- O sampler de rascunhos não compartilha mais o fluxo RNG do alvo, e as distribuições são renormalizadas após a máscara.
Este lançamento fornece binários para macOS, Linux, Windows, Android e openEuler através de vários backends de hardware incluindo CUDA, ROCm, Vulkan, OpenVINO e SYCL.