llama.cpp प्रोजेक्ट ने संस्करण b10413 जारी किया, जिसमें ड्राफ्ट GGUF मॉडल मेटाडेटा से सीधे स्पेकुलेटिव डिकोडिंग स्पेसिफिकेशन टाइप का स्वचालित डिटेक्शन पेश किया गया है।

  • ड्राफ्ट GGUF हेडर से `general.architecture` पढ़कर और `dflash` व `markov_w1.weight` जैसे टेन्सर को `draft-dspark` या `draft-dflash` में मैप करके स्पेक टाइप का ऑटो-डिटेक्शन करता है।
  • स्थानीय ड्राफ्ट मॉडल लोड करते समय `--spec-type` स्पष्ट रूप से निर्दिष्ट न करने पर स्पेकुलेटिव डिकोडिंग निष्क्रिय (टाइप NONE) रहने की समस्या को ठीक करता है।
  • RAII पैटर्न का उपयोग करके स्पेकुलेटिव मॉड्यूल में स्पेक-टाइप डिटेक्शन लॉजिक स्थानांतरित करता है और ऑटो-डिटेक्शन होने पर उपयोगकर्ताओं को सूचित करने के लिए लॉगिंग जोड़ता है।

macOS (Apple Silicon और Intel), iOS, Linux (CPU, Vulkan, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm), और openEuler के लिए बाइनरी प्रदान करता है।

इस बदलाव से स्थानीय ड्राफ्ट मॉडल के लिए स्पेकुलेटिव डिकोडिंग सही ढंग से सक्रिय हो जाती है, जिसके लिए स्पेसिफिकेशन टाइप की मैन्युअल कॉन्फ़िगरेशन की आवश्यकता नहीं होती।