O projeto llama.cpp lançou a compilação b11254, que inclui uma correção em como os tensores de entrada são coletados no grafo de computação. Anteriormente, `graph_inputs` era preenchido durante a divisão do grafo, causando problemas com paralelismo de pipeline onde a alternância entre lotes que consumiam entradas diferentes levava a comparações espúrias de ID de backend e forçava re-reservas do agendador.
- A alteração coleta as entradas após a divisão a partir de todas as folhas de entrada do grafo, garantindo que a composição dependa apenas de quais entradas existem, e não de quais são usadas como fontes.
- Isso impede que o agendador registre tamanhos de entrada menores (por exemplo, `n_outputs = 0`) e aborte posteriormente via `GGML_SCHED_DEBUG_REALLOC`.
- A versão fornece binários para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Android, Windows (CPU, OpenCL, CUDA, Vulkan, OpenVINO, SYCL, ROCm) e openEuler.
Esta correção estabiliza a execução em cenários de paralelismo de pipeline, eliminando recomposições desnecessárias do grafo causadas por mudanças na ordem das entradas.