Topik · Evaluation & benchmarks
lab OpenAI News · 7 hari lalu · 25 tayangan

OpenAI merilis MentalHealthBench untuk mengevaluasi respons kesehatan mental AI

OpenAI telah memperkenalkan MentalHealthBench, sebuah benchmark terbuka yang dirancang untuk mengevaluasi bagaimana sistem AI merespons dalam percakapan kesehatan mental yang realistis. Dikembangkan dengan lebih dari 80 pakar kesehatan mental berlisensi dari 22 negara, benchmark ini menilai kemampuan model di berbagai perilaku kunci seperti keamanan, pencarian konteks, dan pelestarian otonomi pengguna.

media Don't Worry About the Vase · 22 hari lalu · 20 tayangan

Model Astra OpenAI lebih sulit dipantau seiring menurunnya efektivitas Chain of Thought

OpenAI mengakui bahwa model Astra barunya secara signifikan lebih sulit dipantau dibandingkan iterasi sebelumnya, menandai penurunan efektivitas pemantauan Chain of Thought (CoT). Tren ini menunjukkan bahwa seiring meningkatnya kemampuan model, kemampuan untuk mendeteksi ketidaksesuaian melalui analisis CoT berkurang, yang berpotensi membuat sistem pemantauan saat ini tidak dapat diandalkan dalam satu tahun.

arxiv arXiv cs.CL · 2 hari lalu · 1 tayangan

Studi mengungkap divergensi kebijakan epistemik dalam kontaminasi LLM multi-giliran

Sebuah studi berjudul "Divergensi Kebijakan Epistemik dalam Kontaminasi LLM Multi-Giliran: Investigasi Gradien Protokol" mengevaluasi bagaimana model bahasa besar menangani premis palsu yang disuntikkan ke dalam riwayat percakapan, sebuah mode kegagalan yang disebut kontaminasi tingkat sesi. Para peneliti menguji GPT-5.4 Mini, Gemini-3.1 Flash-Lite, dan GLM-4.5-Air di sepuluh domain pengetahuan menggunakan 22.500 giliran pada suhu nol.

arxiv arXiv cs.CL · 2 hari lalu · 1 tayangan

Rep2Act menyelaraskan representasi VLM untuk meningkatkan abstensi pada benchmark VAD-R baru

Para peneliti memperkenalkan Visual Answerability Diagnosis with Rationales (VAD-R), sebuah benchmark baru yang dirancang untuk mengevaluasi kemampuan model visi-bahasa dalam abstensi dari pertanyaan yang tidak dapat dijawab tanpa petunjuk pintasan. Studi ini mengungkapkan bahwa meskipun keadaan tersembunyi dapat membedakan keterjawaban, model saat ini gagal menerjemahkan hal ini menjadi keputusan eksplisit.

media Hugging Face Forums · 2 hari lalu · 1 tayangan

Ujjal Bhattacharjee mengusulkan desain studi untuk menguji debat agen terstruktur untuk tinjauan bukti

Ujjal Bhattacharjee telah mengusangkan kerangka metodologis untuk mengevaluasi apakah tantangan dan revisi terstruktur meningkatkan tugas tinjauan bukti di bawah kendala pengeluaran dan tenggat waktu yang tetap. Proposal tersebut outlines eksperimen empat kondisi yang membandingkan reviewer tunggal, agregasi independen, deliberasi terstruktur, dan deliberasi dengan evaluator Jev.

media Hugging Face Forums · 3 hari lalu · 1 tayangan

SecFathy menolak model XSS khusus 8B karena kegagalan adversarial

Pengembang SecFathy merilis sumber terbuka prototipe penelitian bernama XSS Specialist, sebuah model keamanan 8B yang dirancang untuk analisis kerentanan XSS. Proyek ini awalnya bertujuan mendorong batas spesialisasi menggunakan retrieval dan LoRA, namun akhirnya menolak model tersebut karena gagal dalam uji near-miss adversarial di mana perubahan kecil pada identifier menyebabkan penilaian keamanan yang salah.

media Hugging Face Forums · 3 hari lalu · 9 tayangan

Claude Opus 5 dan Tetsu menemukan enam pemeriksaan CI kosong dalam proyek mereka sendiri

Pada 27 September, Claude Opus 5 dan model 3B Tetsu mengidentifikasi enam pemeriksaan integrasi berkelanjutan terpisah di repositori publik mereka yang melaporkan hijau atau berhasil meskipun gagal memverifikasi apa yang seharusnya mereka ukur. Masalah-masalah tersebut berkisar dari gerbang penyebaran yang menolak restart valid karena digest usang hingga benchmark waktu dengan ambang batas kosong yang menerima perbedaan kinerja yang dapat diabaikan.

media Hugging Face Forums · 4 hari lalu · 7 tayangan

Skepsis komunitas terhadap klaim efisiensi dan kebaruan teknis Jev

Artikel ini membahas lonjakan minat pada "Jev" di LinkedIn, di mana ia dipromosikan sebagai terobosan AI yang revolusioner meskipun penulis menemukan sedikit bukti substantif untuk mendukung klaim tersebut. Penulis mencatat bahwa meskipun Jev mempromosikan efisiensi besar dan paradigma baru, hal itu kekurangan data evaluasi dan detail teknis, menimbulkan pertanyaan apakah hal itu mewakili inovasi arsitektur yang sebenarnya atau hanya klasifikasi yang dikemas ulang.

media Hugging Face Forums · 7 hari lalu · 12 tayangan

Analisis overconfidence buatan pada sistem AI yang dilatih melalui RLHF

Model bahasa besar modern secara sistematis overconfident, mengekspresikan kepercayaan tinggi dalam jawaban yang salah karena insentif pelatihan daripada kegagalan kalibrasi teknis. Selama Reinforcement Learning from Human Feedback (RLHF), penilai manusia memberi hadiah pada respons yang terdengar otoritatif dan definitif, menyebabkan model belajar bahwa ketidakpastian dihukum.

arxiv arXiv cs.CL · 7 hari lalu · 2 tayangan

Benchmark WebMRE mengungkap penguatan timbal balik antara panduan dan tindakan pada agen web

Para penulis memperkenalkan WebMRE, sebuah benchmark offline yang terdiri dari 541 tugas dan 5.293 langkah yang diturunkan dari lintasan WebArena yang berhasil, dirancang untuk menyediakan protokol deterministik dalam menilai titik pemeriksaan agen web tanpa pergeseran lingkungan. Kerangka kerja ini memadukan kalimat panduan berorientasi manusia dengan tindakan yang terlandaskan untuk mempelajari efek penguatan timbal balik di antara keduanya.

lab Hugging Face Blog · 8 hari lalu · 25 tayangan

AISI merilis hasil evaluasi terverifikasi untuk enam model terdepan pada lima benchmark

Institut Keamanan AI Inggris (AISI) telah membuat metode dan temuan evaluasi yang dilaporkan secara publik tersedia melalui platform Kartu Evaluasi EvalEval untuk meningkatkan reproduktibilitas benchmark. Rilis ini mencakup hasil terverifikasi, konteks, dan informasi konfigurasi untuk lima benchmark spesifik: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro, dan Terminal-Bench 2.0.

media Hugging Face Forums · 9 hari lalu · 14 tayangan

CosmicUndercurrent merilis Principia-Structurae-Realitatis untuk menguji koordinasi sistem keseluruhan LLM

CosmicUndercurrent telah membuka sumber sebuah kerangka kerja penalaran yang tidak bergantung pada model, dirancang untuk menguji apakah priming struktural dapat mengurangi inkonsistensi global dalam model bahasa besar. Proyek ini, yang dihosting, menyelidiki apakah proses dua langkah meningkatkan koordinasi sistem keseluruhan dibandingkan dengan kebenaran lokal.