Sumber · arXiv cs.LG
arxiv arXiv cs.LG · 28 hari lalu · 73 tayangan

Model Nemotron-3 dari NVIDIA meraih skor emas dan skor di atas manusia dalam IOI 2026

Para peneliti telah mengembangkan pipeline pasca-pelatihan untuk model bahasa besar yang memungkinkan mereka mencapai kinerja tingkat medali emas dalam pemrograman kompetitif. Dengan menggabungkan penyetelan halus terawasi, pembelajaran penguatan, dan strategi baru berbasis umpan balik bernama GenCorrect, sistem ini mengungguli para kontestan manusia terbaik pada kumpulan soal IOI 2026.

arxiv arXiv cs.LG · 6 hari lalu · 7 tayangan

Kerangka kerja GRASP meningkatkan perencanaan strategis dengan AI agen multi-tahap

Para peneliti memperkenalkan GRASP, sebuah kerangka kerja perencanaan multi-tahap yang sadar strategi, dirancang untuk menghasilkan rencana yang dapat dieksekusi dalam bahasa alami berkualitas tinggi untuk tugas-tugas kompleks dengan memisahkan pipa proses menjadi modul-modul khusus. Sistem ini melakukan pra-kompilasi pedoman makro global melalui GenPlan, mengeksplorasi strategi terlokalisasi melalui RevPlan, dan mengevaluasi lintasan menggunakan diskriminator multi-kriteria bernama VerPlan.

arxiv arXiv cs.LG · 8 hari lalu · 22 tayangan

AIDE^2 memungkinkan peningkatan diri secara rekursif pada agen riset AI

Para peneliti menyajikan AIDE^2, sebuah sistem yang mengimplementasikan siklus peningkatan diri secara rekursif untuk agen riset AI terdepan dengan mengoptimalkan kode internalnya sendiri. Sistem ini mengusulkan perubahan pada logika internalnya, melakukan benchmarking versi yang dimodifikasi pada tugas-tugas R&D AI, dan hanya mempertahankan pembaruan yang berkinerja terbaik pada evaluasi tersembunyi.

arxiv arXiv cs.LG · 8 hari lalu · 21 tayangan

CliffCompaction mengurangi biaya agen pemrograman jangka panjang hingga 50% sambil mempertahankan kinerja

Para peneliti memperkenalkan CliffCompaction, teknik autokompresi yang dirancang untuk agen yang menangani jutaan token, yang memangkas biaya hingga 50% dalam konteks terbatas. Metode ini mempertahankan atau meningkatkan kinerja pada Terminal-Bench dan mencapai hasil terbaik di KernelBench dengan menjaga informasi tetap setia melalui pemotongan alih-alih parafrase.

arxiv arXiv cs.LG · 9 hari lalu HealthBench · 50.1% · 13 tayangan

Fathom-Vaidya meningkatkan penalaran medis dengan hadiah berbasis rubrik

Para penulis memperkenalkan Fathom-Vaidya, model 30B parameter yang menggunakan data sintetis dan pembelajaran penguatan berbasis rubrik untuk meningkatkan penalaran diagnostik dan klinis dalam perawatan kesehatan. Kerangka pelatihan pertama-tama menerapkan RL yang dipandu aturan pada pertanyaan yang berasal dari MedBullets untuk diagnosis, kemudian memanfaatkan 5.3k skenario multi-giliran sintetis dengan rubrik multidimensi untuk tugas klinis interaktif.

arxiv arXiv cs.LG · 15 hari lalu · 28 tayangan

OpenAI merilis Open-1B dengan pelatihan yang sepenuhnya dapat diaudit

OpenAI telah merilis Open-1B, sebuah model bahasa yang dilatih di bawah rezim di mana setiap operasi selama pelatihan dapat direproduksi secara independen pada perangkat keras komersial heterogen dengan kepastian bit demi bit. Pendekatan ini mengatasi masalah reproduktibilitas yang melekat pada model sumber terbuka dengan memberlakukan urutan tertentu pada sumber non-determinisme, seperti reduksi kernel GPU dan pengurutan batch data.

arxiv arXiv cs.LG · 16 hari lalu Codeforces (Elo) · 98.2% · 29 tayangan

Stellar Colosseum: harness banyak-agen untuk penelitian matematika dan TCS jangka panjang

Para penulis memperkenalkan Stellar Colosseum, sebuah harness model-agnostik yang dirancang untuk mengalokasikan inferensi di sepanjang penelitian jangka panjang dalam matematika dan ilmu komputer teoretis. Sistem ini mengeksplorasi strategi alternatif sebelum konstruksi bukti, menggunakan gerbang kesiapan untuk menentukan kapan suatu rute cukup matang untuk dekomposisi, dan merepresentasikan rencana bukti sebagai submasalah tingkat bagian yang saling bergantung.

arxiv arXiv cs.LG · 24 hari lalu · 33 tayangan

Metode Ketidakpastian Spekulatif mengurangi kesalahan agen teknik perangkat lunak menggunakan gerbang model draf

Para penulis menyajikan Ketidakpastian Spekulatif (SU), sebuah teknik yang memulihkan sinyal kegagalan prediktif untuk agen LLM kotak hitam dengan menganalisis token output mereka saja, tanpa memerlukan akses ke logit, bobot, atau aktivasi. Dengan membalikkan decoding spekulatif, model draf berbobot terbuka kecil memberi skor pada lintasan agen dalam satu lemparan maju tunggal untuk mengekstrak fitur yang sadar fase dan mengkalibrasinya terhadap tujuan yang dapat diverifikasi.

arxiv arXiv cs.LG · 27 hari lalu · 51 tayangan

FlashAttention-4 memperkenalkan Direct-P untuk inferensi dan pelatihan FP4 yang sadar perangkat keras

FlashAttention-4 mengatasi keterbatasan kinerja inti tensor floating-point 4-bit (FP4) Blackwell dengan memperkenalkan jalur baru untuk inferensi nonkausal dan pelatihan kausal. Metode ini, yang disebut Direct-P, memetakan skor secara langsung ke probabilitas FP4 untuk melewati overhead konversi softmax yang biasanya mendominasi ketika hasil perkalian matriks mengecil.

arxiv arXiv cs.LG · 29 hari lalu SWE-bench Verified · 16.6% · 42 tayangan

CANOPY memungkinkan Qwen3-14B meraih puncak AppWorld dengan RL berbasis hasil akhir

Makalah ini memperkenalkan CANOPY (Coverage-ANchored On-PolicY RL), sebuah protokol yang mengatasi kelaparan sinyal dan pergeseran kebijakan dalam pembelajaran penguatan jangka panjang untuk model terbuka berukuran kecil. Dengan melakukan skalasi eksplorasi pada tugas yang sama dan menjaga pembaruan tetap terikat KL, metode ini memungkinkan agen belajar secara efektif hanya dari verifikasi di akhir tugas.