Lab · Cognition
lab Mistral AI News · 10 hari lalu · 4 tayangan

Shieldstral memperkenalkan pengklasifikasi keamanan multimodal 3B yang adaptif terhadap kebijakan

Shieldstral adalah pengklasifikasi keamanan multimodal open-weights 3B yang membingkai moderasi konten sebagai tugas penjawab pertanyaan yang adaptif terhadap kebijakan, sehingga memungkinkan penerimaan kebijakan dalam bahasa alami pada saat inferensi tanpa pelatihan ulang. Model ini menyatukan evaluasi keamanan teks dan gambar serta memberikan skor keamanan terkalibrasi di berbagai benchmark sambil berjalan secara efisien pada satu GPU NVIDIA 16GB.

media r/LocalLLaMA · 23 hari lalu

Cactus melakukan post-training pada Gemma 4 E2B dengan probe untuk menghasilkan skor kepercayaan

Cactus telah melakukan post-training pada model Gemma 4 E2B untuk menghasilkan skor kepercayaan antara 0 dan 1 untuk setiap respons, memungkinkan pengembang mengarahkan kueri yang tidak pasti ke model cloud yang lebih besar. Tim mencapai hal ini dengan menambahkan lapisan probe ringan berukuran 68k parameter yang membaca keadaan tersembunyi perantara selama decoding untuk memprediksi probabilitas kesalahan.