El proyecto llama.cpp lanzó la versión b11440, que incluye una corrección para la inicialización especulativa de MTP. La actualización asegura que el programador sea re-reservado cuando cambian las banderas de extracción NextN, previniendo problemas con la extracción no enmascarada.

  • La inicialización especulativa de MTP ahora habilita la extracción NextN en los contextos de destino y borrador después de la creación.
  • El grafo trunk mantiene cada token hasta la última capa en lugar de recortar a las filas de salida.
  • Invalidar la reserva cuando cambian las banderas permite que el siguiente cálculo re-reserve con la nueva forma del grafo.
  • Los binarios están disponibles para macOS, Linux, Windows, Android e iOS a través de backends CPU, GPU y NPU.

Este cambio previene errores GGML_SCHED_DEBUG_REALLOC asegurando la asignación correcta de la forma del lote durante la decodificación.