Server llama.cpp sekarang mengizinkan RANK pooling batch splitting untuk reranker LLM kausal seperti Qwen3 dan Qwen3-VL, menyelesaikan batasan sebelumnya yang merusak reranking dokumen panjang dan multimodal.

  • Sebelumnya, server menolak input RANK-pooling yang lebih besar dari n_ubatch, memaksa semua token ke dalam satu batch fisik.
  • Perbaikan mengekspos llama_get_causal_attn dan llama_model_is_causal untuk memeriksa jenis perhatian secara dinamis alih-alih mengkodekan pemeriksaan arsitektur secara keras.
  • can_split() sekarang memungkinkan chunked prefill untuk RANK pooling ketika konteks bersifat kausal, menghapus logika duplikat di builder grafik.

Perubahan ini memungkinkan pemrosesan dokumen panjang dan input multimodal yang efisien dengan memanfaatkan kemampuan chunked prefill yang melekat pada model kausal.