Cactus ने हर जवाब के लिए 0 से 1 के बीच एक आत्मविश्वास स्कोर जनरेट करने हेतु Gemma 4 E2B मॉडल को पोस्ट-ट्रेन किया है, जिससे डेवलपर्स अनिश्चित क्वेरीज़ को बड़े क्लाउड मॉडल्स में रूट कर सकते हैं। टीम ने डिकोडिंग के दौरान इंटरमीडिएट हाइडन स्टेट्स को पढ़कर त्रुटि की प्रायिकता का अनुमान लगाने वाले एक हल्के 68k पैरामीटर प्रोब लेयर को जोड़कर इसे प्राप्त किया।
- प्रोब ने 12 होल्ड-आउट बेंचमार्क्स पर औसतन 0.814 AUROC हासिल किया, जो 0.549 स्कोर वाले टोकन एंट्रोपी हीयुरिस्टिक्स की तुलना में काफी बेहतर है।
- केवल 15-35% क्वेरीज़ को Gemini 3.1 Flash-Lite में रूट करके, हाइब्रिड सिस्टम अधिकांश बेंचमार्क्स पर उस मॉडल के प्रदर्शन के बराबर है जबकि लागत कम करता है।
- यह तकनीक एक मोडैलिटी-स्वतंत्र सहीता संकेत निकालती है, जिससे शून्य ऑडियो डेटा पर ट्रेन होने के बावजूद प्रोब ऑडियो बेंचमार्क्स पर अच्छा प्रदर्शन करता है।
- वजन HuggingFace पर उपलब्ध हैं और Transformers, MLX, Llama.cpp, और Cactus के लिए कोड MIT लाइसेंस के तहत प्रदान किया गया है।
यह दृष्टिकोण डेवलपर्स को आत्मविश्वास उच्च होने पर ऑन-डिवाइस जवाब स्वीकार करने और निम्न होने पर क्लाउड में हस्तांतरित करने के द्वारा सटीकता के साथ गोपनीयता और गति के बीच संतुलन बनाने की अनुमति देता है।