Training methods
arxiv arXiv cs.LG · 1 hari lalu HealthBench · 50.1% · 10 tayangan

Fathom-Vaidya meningkatkan penalaran medis dengan hadiah berbasis rubrik

Para penulis memperkenalkan Fathom-Vaidya, model 30B parameter yang menggunakan data sintetis dan pembelajaran penguatan berbasis rubrik untuk meningkatkan penalaran diagnostik dan klinis dalam perawatan kesehatan. Kerangka pelatihan pertama-tama menerapkan RL yang dipandu aturan pada pertanyaan yang berasal dari MedBullets untuk diagnosis, kemudian memanfaatkan 5.3k skenario multi-giliran sintetis dengan rubrik multidimensi untuk tugas klinis interaktif.

arxiv arXiv cs.AI · 1 hari lalu HealthBench · 50.1% · 12 tayangan

Fathom-Vaidya meningkatkan penalaran medis dengan hadiah berbasis rubrik

Para penulis memperkenalkan Fathom-Vaidya, sebuah model 30B parameter yang menggunakan data sintetis dan pembelajaran penguatan berbasis rubrik untuk meningkatkan penalaran diagnostik dan klinis dalam perawatan kesehatan. Kerangka pelatihan pertama-tama menargetkan akurasi diagnostik menggunakan pertanyaan yang berasal dari MedBullets dan kemudian menangani interaksi klinis multi-giliran melalui 5,3k skenario yang dihasilkan dengan rubrik multidimensi.

media Latent Space · 1 hari lalu · 13 tayangan

TypeSafe AI memperkenalkan Jev, model System One yang dilatih dengan Pembelajaran Penguatan untuk Keputusan Terkalibrasi

TypeSafe AI telah meluncurkan Jev, kelas baru model "System One" yang dirancang untuk lingkungan produksi. CEO perusahaan dan co-penulis paper InstructGPT, Diogo Almeida, berpendapat bahwa model frontier saat ini lebih memprioritaskan alignment dan penolakan daripada keandalan, menyebabkan masalah seperti halusinasi dan sycophancy.

media MarkTechPost · 6 hari lalu · 20 tayangan

OpenAI merilis kerangka kerja pengungkapan ketidakselarasan model dengan 3 jalur tinjauan

OpenAI telah memperkenalkan kerangka kerja baru untuk melacak, menyelidiki, dan mengungkapkan ketidakselarasan dalam modelnya, disertai enam laporan insiden terperinci dari pelatihan pembelajaran penguatan. Sistem ini menetapkan kriteria dan tenggat waktu spesifik untuk pengungkapan publik, berlaku bahkan ketika perilaku tersebut belum sepenuhnya dijelaskan atau dimitigasi.

arxiv arXiv cs.LG · 7 hari lalu · 20 tayangan

OpenAI merilis Open-1B dengan pelatihan yang sepenuhnya dapat diaudit

OpenAI telah merilis Open-1B, sebuah model bahasa yang dilatih di bawah rezim di mana setiap operasi selama pelatihan dapat direproduksi secara independen pada perangkat keras komersial heterogen dengan kepastian bit demi bit. Pendekatan ini mengatasi masalah reproduktibilitas yang melekat pada model sumber terbuka dengan memberlakukan urutan tertentu pada sumber non-determinisme, seperti reduksi kernel GPU dan pengurutan batch data.

lab Hugging Face Blog · 9 hari lalu · 16 tayangan

TRL v1.14 AsyncGRPOTrainer memungkinkan sinkronisasi hanya LoRA di Hugging Face Jobs

TRL v1.14 memperkenalkan dukungan LoRA ke AsyncGRPOTrainer, memungkinkannya melatih adapter Low-Rank Adaptation dan menyinkronkan hanya file kecil tersebut ke pekerja inferensi vLLM. Arsitektur ini memisahkan tugas pelatihan dan generasi pada mesin yang berbeda dengan menggunakan Storage Bucket bersama sebagai jembatan filesystem, menghilangkan kebutuhan akan NCCL atau komunikasi jaringan langsung antar node.

media Hugging Face Forums · 11 hari lalu · 16 tayangan

pop123-ux merilis 38 notebook yang dapat dijalankan untuk belajar Hugging Face dengan menghapus abstraksi

Pengguna pop123-ux telah menerbitkan repositori pembelajaran yang berisi 38 notebook yang dapat dijalankan yang dirancang untuk membantu pengguna memahami tumpukan Hugging Face dengan secara bertahap menghapus abstraksi tingkat tinggi. Koleksi ini mencakup jalur dari komponen inti seperti transformers dan tokenizers hingga fine-tuning, PEFT, reasoning/RL, dan pekerjaan proyek end-to-end.

media MarkTechPost · 12 hari lalu Berkeley Function-Calling Leaderboard · 83.2% · 18 tayangan

Google Research merilis ToolGrad, sebuah kerangka kerja generasi data penggunaan alat

Peneliti dari Google dan beberapa universitas di Jepang telah memperkenalkan ToolGrad, sebuah kerangka kerja yang membalikkan alur tradisional untuk menghasilkan dataset penggunaan alat dengan membangun rantai API terverifikasi terlebih dahulu, lalu menulis kueri pengguna yang sesuai. Pendekatan ini bertujuan menghilangkan inefisiensi metode berbasis kueri yang sering gagal selama eksplorasi agen.

arxiv arXiv cs.CL · 14 hari lalu SWE-bench Verified · 72.6% · 25 tayangan

ExecCritic menggunakan RL berbasis peran untuk meningkatkan agen pemrograman melalui perbaikan yang dipandu tes

Para peneliti memperkenalkan ExecCritic, sebuah kerangka kerja yang menggabungkan skafolding uji-verifikasi-revisi dengan pembelajaran penguatan berbasis peran untuk meningkatkan agen pemrograman. Sistem ini memisahkan konstruksi tes dari perbaikan kode sumber, menggunakan Agen Uji untuk menghasilkan tes asli repositori dan Agen Perbaikan untuk merevisi kode berdasarkan umpan balik eksekusi.