Sumber · arXiv cs.CL
arxiv arXiv cs.CL · 28 hari lalu · 35 tayangan

Model Nemotron-3 NVIDIA meraih kinerja medali emas dalam kompetisi coding IOI

NVIDIA telah mengembangkan pipeline pasca-pelatihan untuk model bahasa Nemotron-3-Nano-CC dan Nemotron-3-Ultra-CC-nya agar unggul dalam pemrograman kompetitif. Dengan menggabungkan kurasi masalah skala besar, jejak penalaran sintetis, penyetelan halus terawasi (supervised fine-tuning), dan pembelajaran penguatan, tim tersebut menciptakan sistem khusus yang mampu melakukan penalaran algoritmik tingkat tinggi.

arxiv arXiv cs.CL · 17 jam lalu · 1 tayangan

Model Bahasa Konteks mengelola konteks secara asli sebagai file yang dapat diedit

Peneliti memperkenalkan Model Bahasa Konteks (CLM), sebuah arsitektur baru yang memperlakukan jendela konteks model sebagai file yang dapat diedit, memungkinkan model melakukan pembaruan tanpa batas pada memorinya sendiri. Pendekatan ini menggeser manajemen konteks dari kendali harness eksternal ke perilaku model intrinsik, memungkinkan pembelajaran strategi manajemen konteks baik dalam-konteks maupun parametrik.

arxiv arXiv cs.CL · 2 hari lalu · 1 tayangan

Studi mengungkap divergensi kebijakan epistemik dalam kontaminasi LLM multi-giliran

Sebuah studi berjudul "Divergensi Kebijakan Epistemik dalam Kontaminasi LLM Multi-Giliran: Investigasi Gradien Protokol" mengevaluasi bagaimana model bahasa besar menangani premis palsu yang disuntikkan ke dalam riwayat percakapan, sebuah mode kegagalan yang disebut kontaminasi tingkat sesi. Para peneliti menguji GPT-5.4 Mini, Gemini-3.1 Flash-Lite, dan GLM-4.5-Air di sepuluh domain pengetahuan menggunakan 22.500 giliran pada suhu nol.

arxiv arXiv cs.CL · 2 hari lalu SWE-bench Verified · 49.2% · 1 tayangan

ROFT meningkatkan model agentic dengan fine-tuning pada penjelasan yang dihasilkan sendiri

Peneliti menyelidiki Retrospection-Only Fine-Tuning (ROFT), sebuah prosedur online minimal di mana agen menghasilkan penjelasan retrospektif dari pengalamannya sendiri dan dilakukan fine-tuning menggunakan hanya kerugian prediksi token berikutnya pada token penjelasan tersebut. Metode ini tidak memerlukan guru eksternal atau pembaruan kebijakan berbasis imbalan.

arxiv arXiv cs.CL · 2 hari lalu · 1 tayangan

Rep2Act menyelaraskan representasi VLM untuk meningkatkan abstensi pada benchmark VAD-R baru

Para peneliti memperkenalkan Visual Answerability Diagnosis with Rationales (VAD-R), sebuah benchmark baru yang dirancang untuk mengevaluasi kemampuan model visi-bahasa dalam abstensi dari pertanyaan yang tidak dapat dijawab tanpa petunjuk pintasan. Studi ini mengungkapkan bahwa meskipun keadaan tersembunyi dapat membedakan keterjawaban, model saat ini gagal menerjemahkan hal ini menjadi keputusan eksplisit.

arxiv arXiv cs.CL · 3 hari lalu · 6 tayangan

Highlight-Then-Summarize memadatkan bukti untuk pemahaman konteks panjang yang lebih baik

Para peneliti mengusulkan Highlight-Then-Summarize (H2S), sebuah paradigma kompresi-terus-alasan yang mengidentifikasi bukti relevan dengan pertanyaan dan mengintegrasikannya ke dalam ringkasan kompak sebelum menghasilkan jawaban. Untuk mendukung pendekatan ini, tim membangun H2S-Dataset dengan 6.647 contoh dari 11 keluarga benchmark dan memperkenalkan H2S-RL untuk imbalan tingkat proses.

arxiv arXiv cs.CL · 6 hari lalu · 9 tayangan

Kerangka kerja koroutin-bridge memenangkan Jalur 2 CAR-bench dengan Pass^3 sebesar 60,0%

Sebuah kerangka kerja koroutin-bridge baru untuk agen yang menggunakan alat memenangkan Jalur 2 dari evaluasi CAR-bench, mencapai skor Pass@3 sebesar 60,0% pada set uji tersembunyi resmi. Sistem ini memisahkan pemanggilan model dari putaran balik alat dengan membuat model menghasilkan program Python yang memblokir dan melanjutkan kembali di antara pertukaran evaluator.

arxiv arXiv cs.CL · 7 hari lalu · 8 tayangan

VHD-Play menghasilkan lingkungan RL agentic dari mekanisme yang terpecahkan

VHD-Play adalah sebuah pipeline yang menghasilkan beragam lingkungan pembelajaran penguatan (reinforcement learning) agentic dengan cara melakukan sampling dan pemecahan model matematika sebelum merender proses pengambilan keputusan mereka sebagai alat berstatus (stateful). Pendekatan ini memastikan bahwa dinamika yang dapat dieksekusi dan referensi skor lintasan diwarisi langsung dari model yang telah terpecahkan, sehingga mengatasi masalah ketidakselarasan yang umum terjadi pada pipeline generasi yang ada.

arxiv arXiv cs.CL · 7 hari lalu · 2 tayangan

Benchmark WebMRE mengungkap penguatan timbal balik antara panduan dan tindakan pada agen web

Para penulis memperkenalkan WebMRE, sebuah benchmark offline yang terdiri dari 541 tugas dan 5.293 langkah yang diturunkan dari lintasan WebArena yang berhasil, dirancang untuk menyediakan protokol deterministik dalam menilai titik pemeriksaan agen web tanpa pergeseran lingkungan. Kerangka kerja ini memadukan kalimat panduan berorientasi manusia dengan tindakan yang terlandaskan untuk mempelajari efek penguatan timbal balik di antara keduanya.

arxiv arXiv cs.CL · 7 hari lalu SWE-Lancer · 51.47% · 10 tayangan

SkillGym menginternalisasi keterampilan manusia ke dalam LLM untuk pemecahan masalah dunia nyata

Para peneliti memperkenalkan SkillGym, sebuah kerangka kerja yang mengubah keterampilan agen yang ditulis oleh manusia menjadi lingkungan pelatihan yang dapat dieksekusi dan diverifikasi untuk agen model bahasa besar. Sistem ini memanfaatkan pipeline skill-to-task untuk menginisialisasi tugas konkret dan memverifikasi hasil dengan checker berbasis kode.

arxiv arXiv cs.CL · 8 hari lalu · 19 tayangan

TelecomGPT-R1: Pelatihan Pasca-Unifikasi untuk Penalaran Melintasi Tugas Telekomunikasi Heterogen

Para peneliti memperkenalkan TelecomGPT-R1, sebuah keluarga model penalaran telekomunikasi terpadu sumber terbuka yang dirancang untuk mengotomatisasi tugas teknik dengan menalar atas standar, konfigurasi, dan log. Model ini mengatasi keterbatasan LLM umum dan khusus yang ada melalui pendekatan terstruktur yang mencakup aspek protokol, pengetahuan, pemodelan, dan gangguan.

arxiv arXiv cs.CL · 9 hari lalu · 15 tayangan

AgentRouter mengurangi biaya alur kerja agentic sebesar 72% melalui penataan model per langkah

Para peneliti mengusulkan AgentRouter, sebuah klasifikator ringan yang mengoptimalkan alur kerja agentic multi-langkah dengan menata langkah-langkah lintasan individu ke tingkat model yang sesuai, bukan menggunakan satu model terdepan untuk semua tugas. Sistem ini mengatasi inefisiensi sistem perusahaan yang membuang 60-80% dari anggaran inferensi mereka pada sub-tugas yang dapat ditangani sama baiknya oleh model yang lebih kecil.

arxiv arXiv cs.CL · 10 hari lalu · 17 tayangan

NemotronLabs merilis VoiceChat, model obrolan suara dua arah penuh dengan panggilan alat

NemotronLabs telah memperkenalkan VoiceChat, model obrolan suara dua arah penuh dengan bobot terbuka yang dirancang untuk mengintegrasikan pendengaran, transkripsi, penalaran, dan pengucapan dalam satu arsitektur streaming terpadu. Sistem ini menggabungkan encoder suara streaming dan model bahasa decoder-only dengan aliran output paralel khusus untuk teks agen dan panggilan fungsi terstruktur, serta cabang RNN-T tambahan untuk transkripsi pengguna inkremental.