llama.cpp 서버는 이제 Qwen3 및 Qwen3-VL과 같은 인과적 LLM 리랭커에 대해 RANK pooling batch splitting을 허용하여, 기존에 긴 문서 및 멀티모달 리랭킹을 깨뜨리던 제한 사항을 해결했습니다.

  • 이전에는 서버가 n_ubatch보다 큰 RANK-pooling 입력을 거부하여 모든 토큰을 단일 물리적 배치로 강제했습니다.
  • 수정으로 인해 llama_get_causal_attn 및 llama_model_is_causal이 노출되어 아키텍처 검사를 하드코딩하는 대신 주의 유형을 동적으로 확인할 수 있게 되었습니다.
  • can_split()은 이제 컨텍스트가 인과적일 때 RANK pooling에 대한 chunked prefill을 허용하여 그래프 빌더의 중복 로직을 제거했습니다.

이 변경으로 인과적 모델에 내재된 chunked prefill 기능을 활용하여 긴 문서 및 멀티모달 입력의 효율적인 처리가 가능해졌습니다.