El proyecto llama.cpp lanzó la compilación b11254, que incluye una corrección sobre cómo se recopilan los tensores de entrada en el grafo de cómputo. Anteriormente, `graph_inputs` se poblaba durante la división del grafo, lo que causaba problemas con el paralelismo por tubería donde alternar entre lotes que consumían diferentes entradas provocaba comparaciones espurias de ID de backend y forzaba re-reservas del programador.

  • El cambio recopila las entradas después de la división desde todas las hojas de entrada del grafo, asegurando que la composición dependa únicamente de qué entradas existen en lugar de cuáles se usan como fuentes.
  • Esto evita que el programador registre tamaños de entrada más pequeños (por ejemplo, `n_outputs = 0`) y aborte posteriormente mediante `GGML_SCHED_DEBUG_REALLOC`.
  • El lanzamiento proporciona binarios para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Android, Windows (CPU, OpenCL, CUDA, Vulkan, OpenVINO, SYCL, ROCm) y openEuler.

Esta corrección estabiliza la ejecución en escenarios de paralelismo por tubería al eliminar recomposiciones innecesarias del grafo causadas por cambios en el orden de las entradas.