O servidor llama.cpp agora permite RANK pooling batch splitting para rerankers de LLM causais como Qwen3 e Qwen3-VL, resolvendo limitações anteriores que quebravam o reranking de documentos longos e multimodais.

  • Anteriormente, o servidor rejeitava entradas de RANK-pooling maiores que n_ubatch, forçando todos os tokens em um único batch físico.
  • A correção expõe llama_get_causal_attn e llama_model_is_causal para verificar dinamicamente os tipos de atenção em vez de codificar as verificações de arquitetura.
  • can_split() agora permite chunked prefill para RANK pooling quando o contexto é causal, removendo a lógica duplicada no construtor do grafo.

Esta mudança permite o processamento eficiente de documentos longos e entradas multimodais ao aproveitar as capacidades de chunked prefill inerentes aos modelos causais.