Benchmark results
lab Hugging Face Blog · 15 jam lalu · 9 tayangan

AISI merilis hasil evaluasi terverifikasi untuk enam model terdepan pada lima benchmark

Institut Keamanan AI Inggris (AISI) telah membuat metode dan temuan evaluasi yang dilaporkan secara publik tersedia melalui platform Kartu Evaluasi EvalEval untuk meningkatkan reproduktibilitas benchmark. Rilis ini mencakup hasil terverifikasi, konteks, dan informasi konfigurasi untuk lima benchmark spesifik: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro, dan Terminal-Bench 2.0.

media MarkTechPost · 21 jam lalu GDPval-AA (Elo) · 1695.0Elo · 13 tayangan

SpaceXAI merilis Grok 4.7 dengan model dasar lebih besar dan peningkatan benchmark

SpaceXAI telah merilis Grok 4.7, model andalan baru untuk pemrograman, tugas agentic, dan kerja pengetahuan yang memanfaatkan model dasar lebih besar dan durasi pelatihan penguatan (reinforcement learning) lebih panjang dibandingkan Grok 4.6. Model ini mempertahankan struktur harga yang sama dengan pendahulunya sambil menawarkan kemampuan yang ditingkatkan dalam verifikasi diri, penanganan konteks panjang, dan keamanan.

media Hugging Face Forums · 6 hari lalu · 13 tayangan

Indeks Limbah Agen mencetak 341.054 jalankan agen pemrograman publik untuk pola limbah

Indeks Limbah Agen telah mencetak 341.054 lintasan agen dari 11 dataset publik untuk mengidentifikasi inefisiensi seperti loop, percobaan buta, output alat yang terlalu besar, dan jalankan yang ditinggalkan. Analisis mengungkapkan bahwa perilaku loop dan retry sangat umum pada model lemah seperti Llama agents tetapi jarang terjadi pada Claude 3.7 Sonnet dan Qwen3-Coder-480B.

media MarkTechPost · 7 hari lalu LMSYS Arena (Elo) · 1866.0Elo · 20 tayangan

Prior Labs merilis TabPFN-3.5, mengalahkan pemenang Kaggle Otto 2015 dengan pengaturan bawaan

Prior Labs telah merilis TabPFN-3.5, sebuah model fondasi tabel yang melakukan prediksi pada satu tabel dalam satu kali forward pass tanpa pelatihan atau penyetelan per dataset. Model ini mencetak skor 0.375 di papan peringkat privat Tantangan Klasifikasi Produk Grup Otto 2015, mengalahkan skor kemenangan asli sebesar 0.382 yang dicapai oleh Gilberto Titericz dan Stanislav Semenov.

media MarkTechPost · 7 hari lalu · 28 tayangan

Nums AI merilis Causilo, model fondasi tabel yang memimpin TabArena di antara model tunggal

Nums AI telah merilis Causilo, sebuah model fondasi tabel pra-latih untuk klasifikasi dan regresi yang mencapai skor Elo tertinggi di antara model-model tunggal pada TabArena. Model ini menggunakan pendekatan pembelajaran dalam konteks di mana baris pelatihan disimpan sebagai konteks daripada memperbarui bobot, dan tersedia dengan kode Apache-2.0 serta bobot pra-latih di Hugging Face.

arxiv arXiv cs.CL · 8 hari lalu Codeforces (Elo) · 98.2% · 27 tayangan

Stellar Colosseum memanfaatkan inferensi multi-agen untuk penelitian matematika jangka panjang

Stellar Colosseum adalah harness model-agnostik yang dirancang untuk mengalokasikan inferensi pada penelitian jangka panjang di bidang matematika dan ilmu komputer teoretis, mengatasi ketidakandalan model bahasa dalam menangani masalah kompleks. Sistem ini mengeksplorasi strategi alternatif sebelum konstruksi bukti, menggunakan gerbang kesiapan untuk menentukan kapan suatu rute cukup matang untuk dekomposisi, serta merepresentasikan rencana bukti sebagai submasalah tingkat bagian yang saling bergantung.

arxiv arXiv cs.LG · 8 hari lalu Codeforces (Elo) · 98.2% · 25 tayangan

Stellar Colosseum: harness banyak-agen untuk penelitian matematika dan TCS jangka panjang

Para penulis memperkenalkan Stellar Colosseum, sebuah harness model-agnostik yang dirancang untuk mengalokasikan inferensi di sepanjang penelitian jangka panjang dalam matematika dan ilmu komputer teoretis. Sistem ini mengeksplorasi strategi alternatif sebelum konstruksi bukti, menggunakan gerbang kesiapan untuk menentukan kapan suatu rute cukup matang untuk dekomposisi, dan merepresentasikan rencana bukti sebagai submasalah tingkat bagian yang saling bergantung.

arxiv arXiv cs.AI · 9 hari lalu · 25 tayangan

Penilaian ulang oleh ahli mengungkap model terdekat mencapai hampir jenuh pada benchmark fisika

Sebuah studi yang mengaudit enam benchmark fisika yang banyak digunakan menemukan bahwa skor rendah yang dilaporkan untuk model bahasa terdepan sebagian besar disebabkan oleh kesalahan dalam proses benchmarking, bukan karena kekurangan model. Para ahli meninjau pernyataan masalah, solusi referensi, dan respons model, membedakan antara kesalahan asli dengan kesalahan penilai, referensi yang salah, dan pertanyaan yang ambigu.

media MarkTechPost · 10 hari lalu Terminal-Bench 2 · 92.8% · 28 tayangan

Cognition merilis SWE-2, model pemrograman pasca-pelatihan Kimi K3 dengan upaya penalaran yang dapat dipilih

Cognition telah merilis SWE-2, model pemrograman paling mampunya hingga saat ini, yang dipasca-pelatihan dengan pembelajaran penguatan dari model terbuka 2,8T-parameter Moonshot AI, Kimi K3. Model ini mencetak skor 50,0% pada FrontierCode 1.1 Main, menempatkannya dalam jarak satu poin dari Fable 5.1 sambil beroperasi dengan biaya 64% lebih rendah.

lab NVIDIA Research · 11 hari lalu · 16 tayangan

ReasoningBomb memicu penalaran yang secara patologis panjang pada model penalaran besar

Para peneliti telah memformalkan serangan penolakan layanan saat inferensi (PI-DoS) yang memanfaatkan biaya komputasi tinggi dari penalaran eksplisit multi-langkah dalam Model Penalaran Besar (LRM). Mereka menyajikan ReasoningBomb, sebuah kerangka kerja berbasis pembelajaran penguatan yang melatih penyerang untuk menghasilkan prompt alami singkat yang mendorong model korban ke dalam jejak penalaran yang secara patologis panjang dan sering kali tidak berakhir.