llama.cpp サーバーは、Qwen3 や Qwen3-VL などの因果 LLM リランカーに対して RANK pooling batch splitting を許可するようになり、長いドキュメントやマルチモーダルなリランキングを壊していた以前の制限が解消されました。

  • 以前は、サーバーは n_ubatch より大きい RANK-pooling 入力を拒否し、すべてのトークンを単一の物理バッチに強制していました。
  • 修正により llama_get_causal_attn と llama_model_is_causal が公開され、アーキテクチャチェックをハードコードする代わりに注意機構のタイプを動的にチェックできるようになりました。
  • can_split() は、コンテキストが因果である場合、RANK pooling に対して chunked prefill を許可するようになり、グラフビルダー内の重複ロジックが削除されました。

この変更により、因果モデルに内在する chunked prefill の機能を活用して、長いドキュメントやマルチモーダル入力の効率的な処理が可能になります。