Cactus는 Gemma 4 E2B 모델을 사후 학습하여 모든 응답에 대해 0과 1 사이의 신뢰도 점수를 생성하도록 했으며, 이를 통해 개발자는 불확실한 쿼리를 더 큰 클라우드 모델로 라우팅할 수 있습니다. 팀은 디코딩 중 중간 은닉 상태를 읽어오며 오류 발생 확률을 예측하는 경량 68k 파라미터 프로브 레이어를 추가하여 이 결과를 얻었습니다.

  • 프로브는 12개의 홀드아웃 벤치마크에서 평균 0.814 AUROC를 기록했으며, 이는 0.549의 점수를 기록한 토큰 엔트로피 휴리스틱 기법을 크게 상회하는 결과입니다.
  • 쿼리의 15-35%만 Gemini 3.1 Flash-Lite로 라우팅함으로써 하이브리드 시스템은 대부분의 벤치마크에서 해당 모델의 성능을 유지하면서도 비용을 절감했습니다.
  • 이 기법은 모달리티에 독립적인 정확성 신호를 추출하므로, 오디오 데이터 없이 학습되었음에도 오디오 벤치마크에서 우수한 성능을 발휘합니다.
  • 가중치는 HuggingFace에서 제공되며, Transformers, MLX, Llama.cpp 및 Cactus용 코드가 MIT 라이선스 하에 공개되어 있습니다.

이 접근 방식은 신뢰도가 높을 때는 온디바이스 답변을 수용하고 낮을 때는 클라우드로 이전함으로써 개발자가 프라이버시와 속도를 정확도와 균형 있게 조정할 수 있게 합니다.