Para peneliti menyajikan GPQA, sebuah dataset menantang berisi 448 pertanyaan pilihan ganda yang ditulis oleh pakar di bidang biologi, fisika, dan kimia. Benchmark ini dirancang untuk sangat sulit; ahli tingkat PhD hanya mencapai akurasi 65%, sementara non-ahli terampil mencapai 34% bahkan dengan akses web tanpa batas. Sistem AI mutakhir juga kesulitan, dengan baseline GPT-4 terkuat hanya mencapai akurasi 39%. Kesulitan ini bagi manusia dan model terdepan bertujuan untuk memungkinkan eksperisi pengawasan yang realistis dan skalabel untuk mengawasi keluaran AI dalam pengembangan pengetahuan ilmiah.
GPQA: Benchmark Q&A Tingkat Pascasarjana yang Tahan Google
Benchmark
| Benchmark | Model | Skor |
|---|---|---|
| GPQA Diamond | GPT-4 based baseline | 39% |
M$^3$R-Bench memperkenalkan benchmark berbasis bukti untuk pemahaman metafora multimodal
Para peneliti memperkenalkan M$^3$R-Bench, sebuah benchmark terpadu yang berisi 1.000 contoh gambar-teks dengan anotasi yang diverifikasi manusia, dirancang untuk mengevaluasi pemahaman metafora multimodal yang berdasar pada bukti. Benchmark ini menyediakan anotasi gabungan untuk kejadian metafora, pemetaan Target-Sumber, sentimen, dan penjelasan bertahap berdasarkan Teori Metafora Konseptual.
Kerangka kerja Zing meningkatkan kecerdasan sosial LLM melalui benchmark SoMBench dan penjangkaran Actio
Laporan ini memperkenalkan Zing, sebuah kerangka kerja terintegrasi yang dirancang untuk meningkatkan kecerdasan sosial model bahasa besar dengan mengukur, menginternalisasi, dan menjangkarkan kemampuan sosial. Para penulis menyajikan SoMBench, sebuah benchmark berbasis psikologi yang mencakup 17 dimensi sekunder dan 3.481 contoh yang diverifikasi oleh ahli, yang mengungkapkan bahwa LLM saat ini masih memiliki ruang perbaikan signifikan tanpa ada model yang mencapai kinerja hampir maksimal.
Benchmark SRRM mengungkap Qwen2.5-1.5B unggul dari 3B dalam memori konteks panjang
Seorang peneliti mencari persetujuan arXiv cs.CL untuk sebuah makalah yang memperkenalkan Simple Retrieval-Reconstruction Memory (SRRM), sebuah benchmark ringan yang dirancang untuk mengevaluasi memori konteks panjang pada Small Language Models.
Penyetelan halus LLM dengan trait meningkatkan penilaian esai lintas rubrik
Para peneliti mengatasi tantangan penilaian esai otomatis ketika pendidik merevisi atau memperkenalkan rubrik baru, sebuah skenario yang dikenal sebagai generalisasi lintas-rubrik. Mereka mengusulkan kerangka kerja penyetelan halus untuk Model Bahasa Besar yang memanfaatkan representasi perantara bebas-rubrik yang disebut "trait" bersama dengan pengawasan esai target selama pelatihan.
Pelacakan Gurbani Langsung: Benchmark dan Sistem Referensi untuk Subtitel Kirtan Sikh
Para penulis menyajikan sebuah benchmark dan sistem referensi untuk subtitel langsung Kirtan Sikh, yang melibatkan pembacaan nyanyian berkelanjutan dari ayat-ayat Sri Guru Granth Sahib Ji. Berbeda dengan transkripsi kosakata terbuka, tugas ini memerlukan kecocokan kata demi kata yang tepat dari kitab suci kanonik untuk menghindari kesalahan ejaan yang tidak pantas secara agama.