Сервер llama.cpp теперь разрешает RANK pooling batch splitting для каузальных LLM-ранжировщиков, таких как Qwen3 и Qwen3-VL, устраняя предыдущие ограничения, которые нарушали ранжирование длинных документов и мультимодальных данных.

  • Ранее сервер отклонял входные данные RANK-pooling размером больше n_ubatch, заставляя все токены попадать в один физический батч.
  • Исправление использует llama_get_causal_attn и llama_model_is_causal для динамической проверки типов внимания вместо жёстко заданных проверок архитектуры.
  • can_split() теперь позволяет chunked prefill для RANK pooling, когда контекст является каузальным, устраняя дублирование логики в графовом билдере.

Это изменение обеспечивает эффективную обработку длинных документов и мультимодальных входных данных за счёт использования возможностей chunked prefill, присущих каузальным моделям.