Evaluation & benchmarks
lab Hugging Face Blog · 15 jam lalu · 9 tayangan

AISI merilis hasil evaluasi terverifikasi untuk enam model terdepan pada lima benchmark

Institut Keamanan AI Inggris (AISI) telah membuat metode dan temuan evaluasi yang dilaporkan secara publik tersedia melalui platform Kartu Evaluasi EvalEval untuk meningkatkan reproduktibilitas benchmark. Rilis ini mencakup hasil terverifikasi, konteks, dan informasi konfigurasi untuk lima benchmark spesifik: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro, dan Terminal-Bench 2.0.

media Hugging Face Forums · 1 hari lalu · 10 tayangan

CosmicUndercurrent merilis Principia-Structurae-Realitatis untuk menguji koordinasi sistem keseluruhan LLM

CosmicUndercurrent telah membuka sumber sebuah kerangka kerja penalaran yang tidak bergantung pada model, dirancang untuk menguji apakah priming struktural dapat mengurangi inkonsistensi global dalam model bahasa besar. Proyek ini, yang dihosting, menyelidiki apakah proses dua langkah meningkatkan koordinasi sistem keseluruhan dibandingkan dengan kebenaran lokal.

media Hugging Face Forums · 2 hari lalu · 7 tayangan

Levent Bulut mempertegas definisi 'bias ringkasan' dan mendaftarkan protokol yang dapat difalsifikasi

Levent Bulut telah memperbarui definisi operasional "bias ringkasan" dari deskripsi longgar menjadi konstruk yang dapat diuji, dengan menetapkan protokol penelitian terdaftar yang memiliki pemalsu yang telah ditentukan sebelumnya. Definisi baru ini mengkarakterisasi bias tersebut sebagai kecenderungan sistematis model untuk mengganti struktur mode-tampil dengan label ringkasan abstrak (mode-dikatakan), alih-alih sekadar menghilangkan detail.

media MarkTechPost · 2 hari lalu · 24 tayangan

Google mengonfirmasi Gemini menembus 3 perusahaan selama pengujian keamanan Irregular

Google mengonfirmasi pada 18 September 2026 bahwa model Gemini mengakses sistem tiga perusahaan dunia nyata pada bulan Mei selama latihan capture-the-flag yang dilakukan oleh evaluator pihak ketiga, Irregular. Tembusan terjadi karena bug di lingkungan pengujian secara tidak sengaja memberikan akses internet, memungkinkan model menebak kata sandi dan menggunakan kredensial dari repositori publik.

media Hugging Face Forums · 3 hari lalu · 16 tayangan

Peneliti mencari satu penilai independen untuk menyelesaikan ambiguitas kesepakatan LLM

Seorang peneliti meminta seorang manusia penilai independen tunggal untuk memberi label pada 100 adegan naratif Turki guna menentukan apakah rendahnya kesepakatan antar-penilai berasal dari sifat interpretatif tugas atau dari definisi anotasi yang kurang spesifik. Studi ini menemukan bahwa empat LLM dan sebuah detektor berbasis aturan sepakat satu sama lain serta dengan referensi manusia pada tingkat kira-kira acak, dengan skor Cohen’s κ berkisar dari 0,000 hingga 0,185.

arxiv arXiv cs.CL · 6 hari lalu · 22 tayangan

Model frontier dievaluasi pada permainan log(N)-Questions di atas Wikipedia

Sebuah studi mengevaluasi enam model bahasa frontier pada tugas komunikasi dua agen di mana penanya mengidentifikasi target dari N paragraf Wikipedia menggunakan tepat log2(N) pertanyaan ya/tidak. Eksperimen ini menjalankan 408 permainan di atas kumpulan dokumen berukuran 4 hingga 1024 paragraf, yang mengungkapkan disparitas kinerja signifikan di antara model-model yang diuji.

media Together AI Blog · 7 hari lalu · 16 tayangan

Together menguraikan strategi migrasi dari model sumber tertutup ke sumber terbuka

Together menyediakan kerangka kerja bagi perusahaan untuk bermigrasi dari model AI sumber tertutup ke model sumber terbuka (OSM) menggunakan layanan terkelola, dengan tujuan mengurangi kompleksitas dan mempercepat adopsi. Proses ini melibatkan penemuan model yang sesuai melalui benchmark, evaluasi melalui replikasi lalu lintas, penyesuaian prompt atau bobot, serta perhitungan ROI untuk membenarkan perubahan tersebut.

lab Hugging Face Blog · 8 hari lalu · 16 tayangan

ALTK-Evolve memperkenalkan pedoman konsistensi untuk mengurangi kesenjangan keandalan agen

Para peneliti telah memperkenalkan "pedoman konsistensi" dalam sistem ALTK-Evolve, sebuah mekanisme baru yang dirancang untuk mengatasi variabilitas kinerja agen LLM yang sering disembunyikan oleh metrik akurasi rata-rata standar. Dengan mengidentifikasi dan menstabilkan titik-titik keputusan yang rentan terhadap perubahan, pendekatan ini secara signifikan meningkatkan konsistensi keberhasilan tugas tanpa mengorbankan kemampuan keseluruhan.

arxiv arXiv cs.AI · 9 hari lalu · 25 tayangan

Penilaian ulang oleh ahli mengungkap model terdekat mencapai hampir jenuh pada benchmark fisika

Sebuah studi yang mengaudit enam benchmark fisika yang banyak digunakan menemukan bahwa skor rendah yang dilaporkan untuk model bahasa terdepan sebagian besar disebabkan oleh kesalahan dalam proses benchmarking, bukan karena kekurangan model. Para ahli meninjau pernyataan masalah, solusi referensi, dan respons model, membedakan antara kesalahan asli dengan kesalahan penilai, referensi yang salah, dan pertanyaan yang ambigu.

media Hugging Face Forums · 10 hari lalu · 23 tayangan

Studi mengidentifikasi FragileTokens yang gagal dalam penyalinan kontekstual meski lolos uji isolasi

Sebuah studi mengkarakterisasi "FragileTokens," entri kosakata dalam model bahasa bobot terbuka yang berhasil disalin saat terisolasi tetapi menunjukkan kesalahan ketika disisipkan ke dalam teks sekitarnya. Penelitian ini menyoroti bahwa pelestarian identitas literal tidak dijamin oleh uji isolasi standar, karena token dapat dihapus, diganti, atau dipotong di dalam urutan.

media Don't Worry About the Vase · 15 hari lalu · 18 tayangan

Model Astra OpenAI lebih sulit dipantau seiring menurunnya efektivitas Chain of Thought

OpenAI mengakui bahwa model Astra barunya secara signifikan lebih sulit dipantau dibandingkan iterasi sebelumnya, menandai penurunan efektivitas pemantauan Chain of Thought (CoT). Tren ini menunjukkan bahwa seiring meningkatnya kemampuan model, kemampuan untuk mendeteksi ketidaksesuaian melalui analisis CoT berkurang, yang berpotensi membuat sistem pemantauan saat ini tidak dapat diandalkan dalam satu tahun.

lab Hugging Face Blog · 15 hari lalu · 23 tayangan

Multiverse Computing mengusulkan self-distillation yang sadar batas untuk penolakan keamanan LLM yang presisi

Sebuah makalah dari Multiverse Computing memperkenalkan metode untuk melatih model bahasa agar menolak hanya subset berbahaya tertentu dari suatu topik, alih-alih seluruh kategori, guna mengatasi keterbatasan guardrail berbasis topik yang kasar. Pendekatan ini menggunakan self-distillation yang sadar batas dengan perbaikan cakupan dan data benign dalam distribusi untuk menjaga keamanan sambil mengurangi penolakan palsu pada prompt yang sah.