Para peneliti menyajikan GPQA, sebuah dataset menantang berisi 448 pertanyaan pilihan ganda yang ditulis oleh pakar di bidang biologi, fisika, dan kimia. Benchmark ini dirancang untuk sangat sulit; ahli tingkat PhD hanya mencapai akurasi 65%, sementara non-ahli terampil mencapai 34% bahkan dengan akses web tanpa batas. Sistem AI mutakhir juga kesulitan, dengan baseline GPT-4 terkuat hanya mencapai akurasi 39%. Kesulitan ini bagi manusia dan model terdepan bertujuan untuk memungkinkan eksperisi pengawasan yang realistis dan skalabel untuk mengawasi keluaran AI dalam pengembangan pengetahuan ilmiah.
GPQA: Benchmark Q&A Tingkat Pascasarjana yang Tahan Google
Benchmark
| Benchmark | Model | Skor |
|---|---|---|
| GPQA Diamond | GPT-4 based baseline | 39% |
Peneliti mencari satu penilai independen untuk menyelesaikan ambiguitas kesepakatan LLM
Seorang peneliti meminta seorang manusia penilai independen tunggal untuk memberi label pada 100 adegan naratif Turki guna menentukan apakah rendahnya kesepakatan antar-penilai berasal dari sifat interpretatif tugas atau dari definisi anotasi yang kurang spesifik. Studi ini menemukan bahwa empat LLM dan sebuah detektor berbasis aturan sepakat satu sama lain serta dengan referensi manusia pada tingkat kira-kira acak, dengan skor Cohen’s κ berkisar dari 0,000 hingga 0,185.
Studi mengidentifikasi FragileTokens yang gagal dalam penyalinan kontekstual meski lolos uji isolasi
Sebuah studi mengkarakterisasi "FragileTokens," entri kosakata dalam model bahasa bobot terbuka yang berhasil disalin saat terisolasi tetapi menunjukkan kesalahan ketika disisipkan ke dalam teks sekitarnya. Penelitian ini menyoroti bahwa pelestarian identitas literal tidak dijamin oleh uji isolasi standar, karena token dapat dihapus, diganti, atau dipotong di dalam urutan.
GPT-5 dan GPT-5 Nano menyamai para ahli dalam penilaian penelitian onkogenesis mikroba
Sebuah studi menunjukkan bahwa GPT-5 dan GPT-5 Nano mencapai kinerja tingkat ahli dalam mengekstrak bukti dan melakukan penilaian kritis terhadap publikasi penelitian mengenai onkogenesis mikroba. Para peneliti membandingkan model-model ini bersama Gemini 2.5 Pro dan Gemini 2.5 Flash dengan para ahli domain menggunakan dataset yang terdiri dari 24 makalah yang berfokus pada MMTV-LV dan kanker payudara.
GPT-5 dan GPT-5 Nano setara dengan pakar dalam ekstraksi bukti onkogenesis mikroba
Sebuah studi yang membandingkan model bahasa besar pada sintesis bukti sistematis untuk onkogenesis mikroba menemukan bahwa GPT-5 dan GPT-5 Nano berkinerja tak terbedakan dari pakar domain. Para peneliti mengevaluasi Gemini 2.5 Pro, Gemini 2.5 Flash, GPT-5, dan GPT-5 Nano pada 24 makalah penelitian menggunakan templat terstruktur berisi 77 item di berbagai jenis pertanyaan.
M$^3$R-Bench memperkenalkan benchmark berbasis bukti untuk pemahaman metafora multimodal
Para peneliti memperkenalkan M$^3$R-Bench, sebuah benchmark terpadu yang berisi 1.000 contoh gambar-teks dengan anotasi yang diverifikasi manusia, dirancang untuk mengevaluasi pemahaman metafora multimodal yang berdasar pada bukti. Benchmark ini menyediakan anotasi gabungan untuk kejadian metafora, pemetaan Target-Sumber, sentimen, dan penjelasan bertahap berdasarkan Teori Metafora Konseptual.