llama.cpp प्रोजेक्ट ने बिल्ड b11009 जारी किया, जो फ्यूज्ड QKV एटेंशन परतों के लिए विभाजित स्थिति और ग्रैन्युलरिटी गणनाओं से संबंधित महत्वपूर्ण समस्याओं को हल करता है।

  • मॉडल कोड अब n_head * n_embd_head_k के आधार पर attn_qkv के लिए विभाजित स्थितियों की सही गणना करता है, जिससे --fuse-qkv फ्लैग का उपयोग करने वाले gemma4 मॉडलों के साथ संगतता समस्याएं हल हो जाती हैं जहां n_embd 5376 है लेकिन Q 8192 है।
  • qwen35 और qwen35moe आर्किटेक्चर के लिए फ्यूज्ड पूर्ण एटेंशन परतों का समर्थन जोड़ा गया है।
  • Qwen मॉडलों के लिए QGate विभाजन पर और कार्य को ट्रैक करने के लिए एक TODO टैग [TAG_SPLIT_QGATE_QWEN] जोड़ा गया है।

यह रिलीज़ सुनिश्चित करती है कि विशिष्ट मॉडल कॉन्फ़िगरेशन, विशेष रूप से वे जो gemma4 और qwen35 में फ्यूज्ड QKV ऑपरेशंस से जुड़े हैं, स्थिति गणना त्रुटियों के बिना सही ढंग से काम करें।