Benchmark results
arxiv arXiv cs.AI · 3 hari lalu

SciCode-Verified memperbaiki cacat benchmark untuk mengungkap kemampuan pemrograman ilmiah sejati model

Para penulis mengidentifikasi bahwa skor yang stagnan pada benchmark SciCode berasal dari cacat signifikan dalam instrumen evaluasi, bukan dari keterbatasan kemampuan model. Audit oleh pakar domain terhadap 65 soal pengujian menemukan 263 cacat, dengan 192 di antaranya menyebabkan solusi yang benar ditolak secara keliru karena masalah seperti jawaban acuan yang tidak dapat direproduksi dan toleransi yang terlalu ketat.

media AI News (smol.ai) · 4 hari lalu Terminal-Bench 2 · 67.4% · 8 tayangan

Alibaba mengumumkan Qwen3.8-Max dengan 2.4T parameter dan bobot terbuka yang akan datang

Alibaba telah mengumumkan Qwen3.8-Max sebagai model andalan barunya, menggambarkannya sebagai arsitektur sparse 2.4T-parameter yang berfokus pada pekerjaan agentic jangka panjang, pemrograman, dan penalaran multimodal. Perusahaan mengonfirmasi bahwa bobot terbuka untuk Qwen3.8-Max akan dirilis minggu depan bersama varian open-weight Qwen3.8-27B.

media Hugging Face Forums · 7 hari lalu · 8 tayangan

Levent Bulut melakukan benchmark keandalan anotasi LLM pada proyeksi objektif

Levent Bulut menerbitkan sebuah benchmark tiga studi yang mengevaluasi keandalan anotasi yang dihasilkan mesin untuk korpus naratif Turki, mengungkapkan ketidaksesuaian signifikan antara penilai otomatis dan penilaian manusia. Studi ini menguji enam fitur kerajinan biner di 120 dan 100 adegan menggunakan detektor berbasis aturan dan model termasuk Gemini 2.5 Flash, Grok, ChatGPT 5.5, dan Claude Fable 5 High.