El servidor llama.cpp ahora permite RANK pooling batch splitting para rerankers de LLM causales como Qwen3 y Qwen3-VL, resolviendo limitaciones anteriores que rompían el reranking de documentos largos y multimodales.
- Anteriormente, el servidor rechazaba entradas de RANK-pooling mayores que n_ubatch, forzando todos los tokens en un único batch físico.
- La corrección expone llama_get_causal_attn y llama_model_is_causal para verificar dinámicamente los tipos de atención en lugar de codificar las comprobaciones de arquitectura.
- can_split() ahora permite chunked prefill para RANK pooling cuando el contexto es causal, eliminando la lógica duplicada en el constructor del grafo.
Este cambio permite un procesamiento eficiente de documentos largos y entradas multimodales aprovechando las capacidades de chunked prefill inherentes a los modelos causales.