llama.cpp सर्वर अब Qwen3 और Qwen3-VL जैसे कारण-संबंधित LLM रीरैंकर के लिए RANK pooling batch splitting की अनुमति देता है, जिससे लंबे दस्तावेज़ों और बहुआयामी रीरैंकिंग को तोड़ने वाली पिछली सीमाओं को हल किया गया है।
- पहले, सर्वर n_ubatch से बड़े RANK-pooling इनपुट को अस्वीकार कर देता था, जिससे सभी टोकन को एक भौतिक बैच में डालना पड़ता था।
- फिक्स ने llama_get_causal_attn और llama_model_is_causal को एक्सपोज़ किया ताकि आर्किटेक्चर चेक को हार्डकोड करने के बजाय ध्यान प्रकारों की गतिशील रूप से जाँच की जा सके।
- can_split() अब संदर्भ कारण-संबंधित होने पर RANK pooling के लिए chunked prefill की अनुमति देता है, जिससे ग्राफ़ बिल्डर में दोहराए गए तर्क को हटा दिया गया है।
यह बदलाव कारण-संबंधित मॉडल में निहित chunked prefill क्षमताओं का लाभ उठाकर लंबे दस्तावेज़ों और बहुआयामी इनपुट के कुशल प्रसंस्करण को सक्षम बनाता है।