llama.cpp प्रोजेक्ट ने संस्करण b10907 जारी किया, जिसमें मल्टी-टोकन प्रिडिक्शन (MTP) संदर्भ की-वैल्यू कैश आवंटन के लिए एक ठीक शामिल है। यह अपडेट deepseek2, glm4moe और cohere2moe आर्किटेक्चर को प्रभावित करने वाली समस्याओं को दूर करता है।
- deepseek2, glm4moe और cohere2moe मॉडलों के लिए MTP संदर्भ kv कैश आवंटन को ठीक करता है।
- MTP परत फ़िल्टरिंग के लिए उल्टा आर्किटेक्चर गेटिंग और व्यापक आर्किटेक्चर टेस्टिंग जोड़ता है।
- NextN फ़िल्टर टिप्पणी को संक्षिप्त करता है और test-llama-archs परिवर्तनों को हटा देता है।
रिलीज में macOS (Apple Silicon और Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, OpenCL, Vulkan, OpenVINO, SYCL, ROCm) और openEuler के लिए बाइनरी प्रदान करता है।