llama.cpp 프로젝트가 빌드 b11254를 출시했으며, 이는 계산 그래프에서 입력 텐서가 수집되는 방식에 대한 수정을 포함합니다. 이전에는 `graph_inputs`가 그래프 분할 중에 채워져 있어, 서로 다른 입력을 소비하는 배치 간 전환 시 부수적인 백엔드 ID 비교와 스케줄러의 강제 재예약으로 이어지는 파이프라인 병렬화 문제를 유발했습니다.
- 변경 사항은 그래프의 모든 입력 리프에서 분할 후 입력을 수집하여, 구성이 어떤 입력이 사용되는지가 아닌 어떤 입력이 존재하는지에만 의존하도록 보장합니다.
- 이를 통해 스케줄러가 더 작은 입력 크기(예: `n_outputs = 0`)를 기록하고 나중에 `GGML_SCHED_DEBUG_REALLOC`를 통해 중단되는 것을 방지합니다.
- 이번 릴리스는 macOS(Apple Silicon 및 Intel), iOS, Linux(CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Android, Windows(CPU, OpenCL, CUDA, Vulkan, OpenVINO, SYCL, ROCm) 및 openEuler용 바이너리를 제공합니다.
이 수정은 입력 순서 변경으로 인한 불필요한 그래프 재구성을 제거함으로써 파이프라인 병렬화 시나리오에서의 실행을 안정화합니다.