llama.cpp 项目发布了构建版本 b11254,其中包含对计算图中输入张量收集方式的修复。此前,`graph_inputs` 在图拆分期间被填充,导致在流水线并行中出现因切换消耗不同输入的批次而引发的虚假后端 ID 比较,并强制调度器重新预留资源。

  • 该更改在从图的所有输入叶节点拆分后收集输入,确保组合仅取决于存在哪些输入,而非哪些被用作源。
  • 这防止了调度器记录较小的输入大小(例如 `n_outputs = 0`)并通过 `GGML_SCHED_DEBUG_REALLOC` 中止后续操作。
  • 该版本提供了适用于 macOS(Apple Silicon 和 Intel)、iOS、Linux(CPU、Vulkan、CUDA 12/13、ROCm、OpenVINO、SYCL、Snapdragon)、Android、Windows(CPU、OpenCL、CUDA、Vulkan、OpenVINO、SYCL、ROCm)以及 openEuler 的二进制文件。

此修复通过消除由输入顺序变化引起的不必要的图重组,稳定了流水线并行场景下的执行。