Evaluation & benchmarks
lab Hugging Face Blog · 2 hari lalu · 3 tayangan

TutorMoments mengevaluasi apakah tutor AI tahu kapan harus membantu atau menahan diri

Para peneliti memperkenalkan TutorMoments, sebuah kerangka kerja yang dirancang untuk mengukur apakah model bahasa besar dapat menyeimbangkan trade-off pedagogis antara memberikan dukungan dan mendorong penalaran mandiri. Dibangun dari transkrip bimbingan matematika satu-satu yang nyata, sistem ini memutar ulang titik-titik keputusan untuk mengevaluasi perilaku model terhadap ground truth yang dianotasi oleh manusia.

arxiv arXiv cs.CL · 2 hari lalu

M$^3$R-Bench memperkenalkan benchmark berbasis bukti untuk pemahaman metafora multimodal

Para peneliti memperkenalkan M$^3$R-Bench, sebuah benchmark terpadu yang berisi 1.000 contoh gambar-teks dengan anotasi yang diverifikasi manusia, dirancang untuk mengevaluasi pemahaman metafora multimodal yang berdasar pada bukti. Benchmark ini menyediakan anotasi gabungan untuk kejadian metafora, pemetaan Target-Sumber, sentimen, dan penjelasan bertahap berdasarkan Teori Metafora Konseptual.

arxiv arXiv cs.AI · 3 hari lalu

SciCode-Verified memperbaiki cacat benchmark untuk mengungkap kemampuan pemrograman ilmiah sejati model

Para penulis mengidentifikasi bahwa skor yang stagnan pada benchmark SciCode berasal dari cacat signifikan dalam instrumen evaluasi, bukan dari keterbatasan kemampuan model. Audit oleh pakar domain terhadap 65 soal pengujian menemukan 263 cacat, dengan 192 di antaranya menyebabkan solusi yang benar ditolak secara keliru karena masalah seperti jawaban acuan yang tidak dapat direproduksi dan toleransi yang terlalu ketat.

media Hugging Face Forums · 6 hari lalu · 1 tayangan

GPT-5.6 memulihkan 95% pesan tersembunyi dalam benchmark kriptografi sastra yang belum pernah dilihat sebelumnya

Sebuah makalah kerja oleh Joseph JM Walker mengevaluasi model bahasa frontier pada benchmark kriptografi sastra multi-saluran yang belum pernah dilihat sebelumnya, yang tertanam dalam novel fisik "I Wrote a Book and Made a Million Dollars (I.B. Wryten)." Studi ini menemukan bahwa GPT-5.6 secara mandiri mengenali saluran komunikasi sekunder dan memulihkan sekitar 95% materi yang disematkan pada percobaan pertama, sedangkan model-model sebelumnya menunjukkan kemampuan efektif 0%.

media Hugging Face Forums · 7 hari lalu · 8 tayangan

Levent Bulut melakukan benchmark keandalan anotasi LLM pada proyeksi objektif

Levent Bulut menerbitkan sebuah benchmark tiga studi yang mengevaluasi keandalan anotasi yang dihasilkan mesin untuk korpus naratif Turki, mengungkapkan ketidaksesuaian signifikan antara penilai otomatis dan penilaian manusia. Studi ini menguji enam fitur kerajinan biner di 120 dan 100 adegan menggunakan detektor berbasis aturan dan model termasuk Gemini 2.5 Flash, Grok, ChatGPT 5.5, dan Claude Fable 5 High.

media Hugging Face Forums · 8 hari lalu · 2 tayangan

Argumen bahwa sistem agen berumur panjang memerlukan terminologi tata kelola baru

Penulis berargumen bahwa menggambarkan sistem agen berumur panjang yang di-host secara mandiri modern semata-mata sebagai "asisten khusus" atau "memori plus persona" tidak lagi cukup secara teknis. Kerangka kerja lama ini mengurangi perilaku runtime yang kompleks menjadi gaya dan pengambilan sederhana, mengabaikan perbedaan kritis dalam kontinuitas, asal-usul, dan disiplin otoritas.

arxiv arXiv cs.CL · 9 hari lalu · 2 tayangan

OSReward memperkenalkan evaluasi terstandarisasi untuk model hadiah penggunaan komputer lintas platform

Para peneliti memperkenalkan OSReward, sebuah benchmark realistis yang dirancang untuk mengevaluasi keandalan model visi-bahasa (VLM) yang bertindak sebagai hakim untuk lintasan agen penggunaan komputer. Studi ini mengungkapkan bahwa bahkan VLM mutakhir pun mengalami bias kemurahan hati sistematis dan sering kali terlalu mahal untuk skala besar, sementara model terbuka yang terjangkau kinerjanya buruk.

lab NVIDIA Research · 12 hari lalu · 8 tayangan

NVIDIA memperkenalkan Spatial-IQ, kerangka kerja diagnostik hierarkis untuk penalaran spasial model multimodal

Peneliti di NVIDIA telah memperkenalkan Spatial-IQ, sebuah kerangka kerja diagnostik yang dirancang untuk mengurai kecerdasan spasial dari model bahasa besar multimodal (MLLM). Berbeda dengan benchmark yang ada yang memperlakukan model sebagai kotak hitam, pendekatan ini menguraikan penghitungan objek dalam struktur 3D bertumpuk menjadi sembilan sub-tugas perseptual dan kognitif yang selaras dengan tahap perkembangan manusia.

arxiv arXiv cs.AI · 12 hari lalu

Modul Kelayakan Aethis menggunakan arsitektur neuro-simbolik untuk memperbaiki kesalahan evaluasi aturan LLM

Artikel ini mendokumentasikan kelas kegagalan dalam model bahasa besar terdepan yang disebut keruntuhan rantai pengecualian, di mana model mengevaluasi aturan kondisional bersarang secara salah. Untuk mengatasi hal ini, para penulis menyajikan Modul Kelayakan Aethis, sebuah arsitektur neuro-simbolik yang menggabungkan aturan yang ditulis oleh LLM dengan lapisan berbasis SMT untuk eksekusi deterministik.

arxiv arXiv cs.CL · 12 hari lalu

Kerangka kerja Zing meningkatkan kecerdasan sosial LLM melalui benchmark SoMBench dan penjangkaran Actio

Laporan ini memperkenalkan Zing, sebuah kerangka kerja terintegrasi yang dirancang untuk meningkatkan kecerdasan sosial model bahasa besar dengan mengukur, menginternalisasi, dan menjangkarkan kemampuan sosial. Para penulis menyajikan SoMBench, sebuah benchmark berbasis psikologi yang mencakup 17 dimensi sekunder dan 3.481 contoh yang diverifikasi oleh ahli, yang mengungkapkan bahwa LLM saat ini masih memiliki ruang perbaikan signifikan tanpa ada model yang mencapai kinerja hampir maksimal.

media Hugging Face Forums · 15 hari lalu

Jeanbosange merilis prototipe Audit Runtime LIMEN untuk memeriksa lintasan aktivasi per lapisan

Jeanbosange telah menerbitkan prototipe publik pertama dari Audit Runtime LIMEN, sebuah toolkit sumber terbuka yang dirancang untuk memeriksa lintasan aktivasi per lapisan pada model bahasa bobot terbuka. Alat ini memperlakukan urutan keadaan tersembunyi di seluruh lapisan sebagai lintasan yang dapat diukur, menyediakan lapisan observabilitas yang dapat direproduksi untuk membandingkan perilaku runtime internal.