A Cactus realizou o pós-treinamento do modelo Gemma 4 E2B para gerar um escore de confiança entre 0 e 1 para cada resposta, permitindo que desenvolvedores direcionem consultas incertas para modelos maiores na nuvem. A equipe conseguiu isso adicionando uma camada de probe leve com 68k parâmetros que lê os estados ocultos intermediários durante a decodificação para prever a probabilidade de um erro.
- O probe alcança média de 0.814 AUROC em 12 benchmarks hold-out, superando significativamente as heurísticas de entropia de tokens, que pontuaram 0.549.
- Ao direcionar apenas 15-35% das consultas para o Gemini 3.1 Flash-Lite, o sistema híbrido iguala o desempenho desse modelo na maioria dos benchmarks enquanto reduz custos.
- A técnica extrai um sinal de correção independente de modalidade, permitindo que o probe tenha bom desempenho em benchmarks de áudio apesar de ter sido treinado com zero dados de áudio.
- Os pesos estão disponíveis no HuggingFace com código fornecido para Transformers, MLX, Llama.cpp e Cactus, sob licença MIT.
Essa abordagem permite que desenvolvedores equilibrem privacidade e velocidade com precisão, aceitando respostas on-device quando a confiança é alta e transferindo para a nuvem quando é baixa.