Проект llama.cpp выпустил сборку b11254, которая включает исправление способа сбора входных тензоров в вычислительном графе. Ранее `graph_inputs` заполнялся во время разделения графа, что вызывало проблемы с конвейерным параллелизмом: переключение между пакетами, потребляющими разные входные данные, приводило к ложным сравнениям идентификаторов бэкенда и принудительным повторным резервированиям планировщика.
- Изменение собирает входные данные после разделения из всех листовых узлов входа графа, обеспечивая, чтобы композиция зависела только от наличия входов, а не от того, какие из них используются как источники.
- Это предотвращает запись планировщиком меньших размеров входов (например, `n_outputs = 0`) и последующее прерывание через `GGML_SCHED_DEBUG_REALLOC`.
- Релиз предоставляет бинарные файлы для macOS (Apple Silicon и Intel), iOS, Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Android, Windows (CPU, OpenCL, CUDA, Vulkan, OpenVINO, SYCL, ROCm) и openEuler.
Это исправление стабилизирует выполнение в сценариях конвейерного параллелизма за счёт устранения ненужных пересборок графа, вызванных изменениями порядка входных данных.