Google telah meluncurkan evaluasi buta ganda pertama di dunia untuk model AI kelas frontier milik pribadi bekerja sama dengan Singapore AI Safety Institute, OpenMined, AVERI, dan MLCommons. Pilot ini menguji model Gemini Flash Lite terhadap benchmark rahasia dalam lingkungan yang melestarikan privasi untuk mencegah kontaminasi benchmark.

Inisiatif ini memanfaatkan Google Cloud’s Confidential Space untuk memverifikasi secara kriptografis bahwa data evaluasi eksternal dan bobot model milik pribadi tetap privat bagi pemilik masing-masing. Pendekatan ini menghilangkan kompromi historis antara mengungkapkan prompt pengujian atau membagikan bobot model, memastikan tidak ada pihak yang dapat mengakses informasi sensitif pihak lain selama pengujian.

Dengan mencegah model melihat pertanyaan evaluasi sebelumnya, metode ini bertujuan meningkatkan integritas evaluasi dan memberikan kepada pembuat kebijakan serta perusahaan metrik terpercaya mengenai kemampuan dan keamanan sejati model.