llama.cpp 服务器现在允许对 Qwen3 和 Qwen3-VL 等因果 LLM 重排序器使用 RANK pooling batch splitting,解决了之前破坏长文档和多模态重排序的限制。

  • 以前,服务器拒绝大于 n_ubatch 的 RANK-pooling 输入,强制将所有 token 放入单个物理批次中。
  • 修复方案暴露了 llama_get_causal_attn 和 llama_model_is_causal,以动态检查注意力类型,而不是硬编码架构检查。
  • can_split() 现在允许在上下文为因果时进行 RANK pooling 的 chunked prefill,消除了图构建器中的重复逻辑。

此更改通过利用因果模型固有的 chunked prefill 能力,实现了对长文档和多模态输入的高效处理。