Le serveur llama.cpp autorise désormais le RANK pooling batch splitting pour les rerankers LLM causaux tels que Qwen3 et Qwen3-VL, résolvant des limitations précédentes qui cassaient le reranking de documents longs et multimodaux.

  • Auparavant, le serveur rejetait les entrées RANK-pooling supérieures à n_ubatch, forçant tous les tokens dans un seul batch physique.
  • La correction expose llama_get_causal_attn et llama_model_is_causal pour vérifier dynamiquement les types d'attention au lieu de coder en dur les vérifications d'architecture.
  • can_split() autorise désormais le chunked prefill pour le RANK pooling lorsque le contexte est causal, supprimant la logique dupliquée dans le builder de graphe.

Ce changement permet un traitement efficace des documents longs et des entrées multimodales en exploitant les capacités de chunked prefill inhérentes aux modèles causaux.