연구소 · Cognition
lab Mistral AI News · 10일 전 · 조회수 4회

Shieldstral이 정책 적응형 3B 다중 모달 안전 분류기 선보임

Shieldstral은 콘텐츠 검수를 정책 적응형 질문 답변 작업으로 구성하는 3B 오픈 가중치 다중 모달 안전 분류기로, 재학습 없이 추론 시 일반 언어 정책을 받아들일 수 있습니다. 이는 텍스트와 이미지 안전 평가를 통합하고 다양한 벤치마크에서 교정된 안전 점수를 제공하며 단일 16GB NVIDIA GPU에서 효율적으로 실행됩니다.

media r/LocalLLaMA · 23일 전

Cactus가 프로브를 활용해 Gemma 4 E2B의 사후 학습을 통해 신뢰도 점수를 출력

Cactus는 Gemma 4 E2B 모델을 사후 학습하여 모든 응답에 대해 0과 1 사이의 신뢰도 점수를 생성하도록 했으며, 이를 통해 개발자는 불확실한 쿼리를 더 큰 클라우드 모델로 라우팅할 수 있습니다. 팀은 디코딩 중 중간 은닉 상태를 읽어오며 오류 발생 확률을 예측하는 경량 68k 파라미터 프로브 레이어를 추가하여 이 결과를 얻었습니다.