El proyecto llama.cpp lanzó la versión b11440, que incluye una corrección para la inicialización especulativa de MTP. La actualización asegura que el programador sea re-reservado cuando cambian las banderas de extracción NextN, previniendo problemas con la extracción no enmascarada.
- La inicialización especulativa de MTP ahora habilita la extracción NextN en los contextos de destino y borrador después de la creación.
- El grafo trunk mantiene cada token hasta la última capa en lugar de recortar a las filas de salida.
- Invalidar la reserva cuando cambian las banderas permite que el siguiente cálculo re-reserve con la nueva forma del grafo.
- Los binarios están disponibles para macOS, Linux, Windows, Android e iOS a través de backends CPU, GPU y NPU.
Este cambio previene errores GGML_SCHED_DEBUG_REALLOC asegurando la asignación correcta de la forma del lote durante la decodificación.