Topik · Training methods
arxiv arXiv cs.CL · 16 jam lalu · 1 tayangan

Model Bahasa Konteks mengelola konteks secara asli sebagai file yang dapat diedit

Peneliti memperkenalkan Model Bahasa Konteks (CLM), sebuah arsitektur baru yang memperlakukan jendela konteks model sebagai file yang dapat diedit, memungkinkan model melakukan pembaruan tanpa batas pada memorinya sendiri. Pendekatan ini menggeser manajemen konteks dari kendali harness eksternal ke perilaku model intrinsik, memungkinkan pembelajaran strategi manajemen konteks baik dalam-konteks maupun parametrik.

arxiv arXiv cs.CL · 2 hari lalu SWE-bench Verified · 49.2% · 1 tayangan

ROFT meningkatkan model agentic dengan fine-tuning pada penjelasan yang dihasilkan sendiri

Peneliti menyelidiki Retrospection-Only Fine-Tuning (ROFT), sebuah prosedur online minimal di mana agen menghasilkan penjelasan retrospektif dari pengalamannya sendiri dan dilakukan fine-tuning menggunakan hanya kerugian prediksi token berikutnya pada token penjelasan tersebut. Metode ini tidak memerlukan guru eksternal atau pembaruan kebijakan berbasis imbalan.

arxiv arXiv cs.CL · 7 hari lalu · 8 tayangan

VHD-Play menghasilkan lingkungan RL agentic dari mekanisme yang terpecahkan

VHD-Play adalah sebuah pipeline yang menghasilkan beragam lingkungan pembelajaran penguatan (reinforcement learning) agentic dengan cara melakukan sampling dan pemecahan model matematika sebelum merender proses pengambilan keputusan mereka sebagai alat berstatus (stateful). Pendekatan ini memastikan bahwa dinamika yang dapat dieksekusi dan referensi skor lintasan diwarisi langsung dari model yang telah terpecahkan, sehingga mengatasi masalah ketidakselarasan yang umum terjadi pada pipeline generasi yang ada.

arxiv arXiv cs.CL · 7 hari lalu SWE-Lancer · 51.47% · 10 tayangan

SkillGym menginternalisasi keterampilan manusia ke dalam LLM untuk pemecahan masalah dunia nyata

Para peneliti memperkenalkan SkillGym, sebuah kerangka kerja yang mengubah keterampilan agen yang ditulis oleh manusia menjadi lingkungan pelatihan yang dapat dieksekusi dan diverifikasi untuk agen model bahasa besar. Sistem ini memanfaatkan pipeline skill-to-task untuk menginisialisasi tugas konkret dan memverifikasi hasil dengan checker berbasis kode.

lab Hugging Face Blog · 7 hari lalu · 16 tayangan

NVIDIA Warp dan MjWarp memungkinkan simulasi robotika paralel yang dipercepat GPU

MuJoCo Warp (MJWarp), dibangun di atas NVIDIA Warp, memungkinkan model MuJoCo yang kompatibel berjalan pada skala GPU, sehingga memungkinkan pengembangan ratusan atau ribuan dunia simulasi independen dalam satu panggilan. Arsitektur ini menggeser fokus dari meminimalkan latensi untuk satu lingkungan ke meningkatkan throughput agregat, yang menguntungkan pembelajaran penguatan dan pengambilan sampel skala besar.

arxiv arXiv cs.LG · 9 hari lalu HealthBench · 50.1% · 13 tayangan

Fathom-Vaidya meningkatkan penalaran medis dengan hadiah berbasis rubrik

Para penulis memperkenalkan Fathom-Vaidya, model 30B parameter yang menggunakan data sintetis dan pembelajaran penguatan berbasis rubrik untuk meningkatkan penalaran diagnostik dan klinis dalam perawatan kesehatan. Kerangka pelatihan pertama-tama menerapkan RL yang dipandu aturan pada pertanyaan yang berasal dari MedBullets untuk diagnosis, kemudian memanfaatkan 5.3k skenario multi-giliran sintetis dengan rubrik multidimensi untuk tugas klinis interaktif.

arxiv arXiv cs.AI · 9 hari lalu HealthBench · 50.1% · 16 tayangan

Fathom-Vaidya meningkatkan penalaran medis dengan hadiah berbasis rubrik

Para penulis memperkenalkan Fathom-Vaidya, sebuah model 30B parameter yang menggunakan data sintetis dan pembelajaran penguatan berbasis rubrik untuk meningkatkan penalaran diagnostik dan klinis dalam perawatan kesehatan. Kerangka pelatihan pertama-tama menargetkan akurasi diagnostik menggunakan pertanyaan yang berasal dari MedBullets dan kemudian menangani interaksi klinis multi-giliran melalui 5,3k skenario yang dihasilkan dengan rubrik multidimensi.

media Latent Space · 9 hari lalu · 22 tayangan

TypeSafe AI memperkenalkan Jev, model System One yang dilatih dengan Pembelajaran Penguatan untuk Keputusan Terkalibrasi

TypeSafe AI telah meluncurkan Jev, kelas baru model "System One" yang dirancang untuk lingkungan produksi. CEO perusahaan dan co-penulis paper InstructGPT, Diogo Almeida, berpendapat bahwa model frontier saat ini lebih memprioritaskan alignment dan penolakan daripada keandalan, menyebabkan masalah seperti halusinasi dan sycophancy.

media MarkTechPost · 13 hari lalu · 23 tayangan

OpenAI merilis kerangka kerja pengungkapan ketidakselarasan model dengan 3 jalur tinjauan

OpenAI telah memperkenalkan kerangka kerja baru untuk melacak, menyelidiki, dan mengungkapkan ketidakselarasan dalam modelnya, disertai enam laporan insiden terperinci dari pelatihan pembelajaran penguatan. Sistem ini menetapkan kriteria dan tenggat waktu spesifik untuk pengungkapan publik, berlaku bahkan ketika perilaku tersebut belum sepenuhnya dijelaskan atau dimitigasi.

arxiv arXiv cs.LG · 15 hari lalu · 28 tayangan

OpenAI merilis Open-1B dengan pelatihan yang sepenuhnya dapat diaudit

OpenAI telah merilis Open-1B, sebuah model bahasa yang dilatih di bawah rezim di mana setiap operasi selama pelatihan dapat direproduksi secara independen pada perangkat keras komersial heterogen dengan kepastian bit demi bit. Pendekatan ini mengatasi masalah reproduktibilitas yang melekat pada model sumber terbuka dengan memberlakukan urutan tertentu pada sumber non-determinisme, seperti reduksi kernel GPU dan pengurutan batch data.