Cactus a post-entraîné le modèle Gemma 4 E2B afin de générer un score de confiance compris entre 0 et 1 pour chaque réponse, permettant aux développeurs d'acheminer les requêtes incertaines vers des modèles cloud plus grands. L'équipe y est parvenue en ajoutant une couche de sonde légère de 68k paramètres qui lit les états cachés intermédiaires pendant le décodage pour prédire la probabilité d'une erreur.

  • La sonde affiche une AUROC moyenne de 0.814 sur 12 jeux de tests séparés, surpassant significativement les heuristiques d'entropie des tokens qui ont obtenu un score de 0.549.
  • En acheminant uniquement 15 à 35 % des requêtes vers Gemini 3.1 Flash-Lite, le système hybride égale les performances de ce modèle sur la plupart des benchmarks tout en réduisant les coûts.
  • La technique extrait un signal de correction indépendant de la modalité, permettant à la sonde d'obtenir de bons résultats sur les benchmarks audio malgré l'absence de données audio lors de l'entraînement.
  • Les poids sont disponibles sur HuggingFace avec le code fourni pour Transformers, MLX, Llama.cpp et Cactus, sous licence MIT.

Cette approche permet aux développeurs d'équilibrer confidentialité et vitesse avec précision en acceptant les réponses sur appareil lorsque la confiance est élevée et en transférant au cloud lorsqu'elle est faible.