قامت Cactus بإعادة تدريب نموذج Gemma 4 E2B لتوليد درجة ثقة تتراوح بين 0 و1 لكل رد، مما يمكّن المطورين من توجيه الاستفسارات غير المؤكدة إلى نماذج سحابية أكبر. حقق الفريق ذلك عن طريق إضافة طبقة مجس خفيفة الوزن تحتوي على 68k معلمة تقرأ الحالات المخفية الوسيطة أثناء فك التشفير للتنبؤ باحتمالية حدوث خطأ.

  • يبلغ متوسط AUROC للمجس 0.814 عبر 12 معيارًا احتياطيًا، متفوقًا بشكل كبير على الاستدلالات القائمة على إنتروبيا الرمز التي حصلت على 0.549.
  • من خلال توجيه 15-35% فقط من الاستفسارات إلى Gemini 3.1 Flash-Lite، يطابق النظام الهجين أداء ذلك النموذج في معظم المعايير مع تقليل التكاليف.
  • تستخرج التقنية إشارة صحة مستقلة عن الوسيط، مما يسمح للمجس بأداء جيد في معايير الصوت رغم تدريبه على صفر بيانات صوتية.
  • الأوزاء متاحة على HuggingFace مع توفير الكود لـ Transformers وMLX وLlama.cpp وCactus، بموجب ترخيص MIT.

يتيح هذا النهج للمطورين الموازنة بين الخصوصية والسرعة والدقة من خلال قبول الإجابات المحلية عندما تكون الثقة عالية، وتسليمها إلى السحابة عندما تكون منخفضة.