llama.cpp परियोजना ने बिल्ड b11227 जारी किया, जिसमें बहुआयामी प्रसंस्करण के दौरान `causal_attn` फ्लैग के हैंडलिंग के लिए विशेष रूप से लक्षित प्रदर्शन अनुकूलन शामिल हैं।
- शेड्यूलर अब `causal_attn` टॉगल करते समय मेमोरी को फिर से आरक्षित नहीं करता है, जिससे महंगे पास समाप्त हो गए जो पहले Gemma जैसे मॉडलों के लिए दृश्य इनपुट को धीमा कर देते थे।
- qwen4exp इंडेक्सर बायस का आकार अब `causal_attn` से स्वतंत्र है, जिससे `GGML_SCHED_NO_REALLOC` प्रतिबंधों के तहत बफर रीअलोकेशन विफलताओं को रोका जाता है।
- gemma-4-26B-A4B के साथ llama-server पर बेंचमार्क में महत्वपूर्ण विलंबता कमी दिखाई गई, जैसे कि RTX 4090 पर 24 छवियों के लिए 7.61x गति और बड़े संदर्भ सेटिंग्स के साथ H200 पर 3.40x तक।
ये बदलाव उत्पन्न आउटपुट या ग्राफ पुनर्निर्माण व्यवहार को बदले बिना बहु-छवि और वीडियो इनपुट के लिए निष्पादन गति को बेहतर बनाते हैं।