Cactus провела постобучение модели Gemma 4 E2B для генерации оценки уверенности в диапазоне от 0 до 1 для каждого ответа, что позволяет разработчикам перенаправлять неопределённые запросы на более мощные облачные модели. Команда достигла этого, добавив лёгкий слой зонда из 68 тысяч параметров, который считывает промежуточные скрытые состояния во время декодирования для прогнозирования вероятности ошибки.
- Зонд демонстрирует среднюю AUROC 0.814 по 12 тестовым выборкам, значительно превосходя эвристики на основе энтропии токенов, которые показали результат 0.549.
- Перенаправляя только 15–35% запросов в Gemini 3.1 Flash-Lite, гибридная система достигает производительности этой модели по большинству бенчмарков при снижении затрат.
- Метод извлекает модально-независимый сигнал корректности, позволяя зонду хорошо работать на аудио-бенчмарках, несмотря на обучение исключительно на текстовых данных без аудиозаписей.
Веса доступны на HuggingFace, код предоставлен для Transformers, MLX, Llama.cpp и Cactus под лицензией MIT.
Этот подход позволяет разработчикам балансировать между конфиденциальностью, скоростью и точностью: принимать ответы на устройстве при высокой уверенности и передавать запросы в облако при низкой.