Cactus ha post-entrenado el modelo Gemma 4 E2B para generar una puntuación de confianza entre 0 y 1 para cada respuesta, permitiendo a los desarrolladores enrutar consultas inciertas hacia modelos en la nube más grandes. El equipo logró esto añadiendo una capa de sonda ligera de 68k parámetros que lee los estados ocultos intermedios durante la decodificación para predecir la probabilidad de un error.
- La sonda promedia 0.814 AUROC en 12 conjuntos de prueba retenidos, superando significativamente las heurísticas de entropía de tokens que obtuvieron 0.549.
- Al enrutar solo el 15-35% de las consultas a Gemini 3.1 Flash-Lite, el sistema híbrido iguala el rendimiento de ese modelo en la mayoría de los benchmarks mientras reduce los costos.
- La técnica extrae una señal de corrección independiente de la modalidad, permitiendo que la sonda funcione bien en benchmarks de audio a pesar de haber sido entrenada con cero datos de audio.
- Los pesos están disponibles en HuggingFace con el código proporcionado para Transformers, MLX, Llama.cpp y Cactus, bajo una licencia MIT.
Este enfoque permite a los desarrolladores equilibrar la privacidad y la velocidad con la precisión al aceptar respuestas en el dispositivo cuando la confianza es alta y transferir a la nube cuando es baja.