Lab · Alibaba (Qwen)
arxiv arXiv cs.AI · 2 hari lalu · 1 tayangan

RareDx menggunakan optimasi kebijakan berbasis graf untuk meningkatkan diagnosis penyakit langka

Para penulis memperkenalkan RareDx, sebuah sistem yang menggabungkan penggunaan bukti terkontrol dengan optimasi kebijakan berbasis grafik pengetahuan untuk mengatasi masalah penalaran long-tail dalam diagnosis penyakit langka. Pipeline pelatihan menggabungkan Top-10 pasca-pelatihan dengan RareDx-KGPO, yang memproyeksikan prediksi ke dalam grafik penyakit kanonik dan mengintegrasikan relevansi bertingkat yang dikurasi, kedekatan ontologi, kesamaan biomedis, dan konsistensi fenotipe.

arxiv arXiv cs.CL · 2 hari lalu · 1 tayangan

Rep2Act menyelaraskan representasi VLM untuk meningkatkan abstensi pada benchmark VAD-R baru

Para peneliti memperkenalkan Visual Answerability Diagnosis with Rationales (VAD-R), sebuah benchmark baru yang dirancang untuk mengevaluasi kemampuan model visi-bahasa dalam abstensi dari pertanyaan yang tidak dapat dijawab tanpa petunjuk pintasan. Studi ini mengungkapkan bahwa meskipun keadaan tersembunyi dapat membedakan keterjawaban, model saat ini gagal menerjemahkan hal ini menjadi keputusan eksplisit.

arxiv arXiv cs.CL · 7 hari lalu · 8 tayangan

VHD-Play menghasilkan lingkungan RL agentic dari mekanisme yang terpecahkan

VHD-Play adalah sebuah pipeline yang menghasilkan beragam lingkungan pembelajaran penguatan (reinforcement learning) agentic dengan cara melakukan sampling dan pemecahan model matematika sebelum merender proses pengambilan keputusan mereka sebagai alat berstatus (stateful). Pendekatan ini memastikan bahwa dinamika yang dapat dieksekusi dan referensi skor lintasan diwarisi langsung dari model yang telah terpecahkan, sehingga mengatasi masalah ketidakselarasan yang umum terjadi pada pipeline generasi yang ada.

arxiv arXiv cs.CL · 7 hari lalu SWE-Lancer · 51.47% · 10 tayangan

SkillGym menginternalisasi keterampilan manusia ke dalam LLM untuk pemecahan masalah dunia nyata

Para peneliti memperkenalkan SkillGym, sebuah kerangka kerja yang mengubah keterampilan agen yang ditulis oleh manusia menjadi lingkungan pelatihan yang dapat dieksekusi dan diverifikasi untuk agen model bahasa besar. Sistem ini memanfaatkan pipeline skill-to-task untuk menginisialisasi tugas konkret dan memverifikasi hasil dengan checker berbasis kode.

arxiv arXiv cs.AI · 8 hari lalu · 17 tayangan

VideoX-Qwen memperkenalkan kerangka kerja berpusat pada data untuk pengeditan video berbasis instruksi

Peneliti mempersembahkan VideoX-Qwen, sebuah kerangka kerja terintegrasi yang menggabungkan konstruksi data yang dapat diskalakan dengan pelatihan model untuk memajukan pengeditan video tujuan umum yang digerakkan oleh instruksi. Sistem ini memanfaatkan pipeline produksi yang mengorganisir model khusus untuk menghasilkan catatan pengeditan arah, menghasilkan lebih dari 1,2 juta sampel berkualitas tinggi dalam tugas penambahan, penghapusan, penggantian, dan atribut.

lab Hugging Face Blog · 16 hari lalu · 19 tayangan

TRL v1.14 AsyncGRPOTrainer memungkinkan sinkronisasi hanya LoRA di Hugging Face Jobs

TRL v1.14 memperkenalkan dukungan LoRA ke AsyncGRPOTrainer, memungkinkannya melatih adapter Low-Rank Adaptation dan menyinkronkan hanya file kecil tersebut ke pekerja inferensi vLLM. Arsitektur ini memisahkan tugas pelatihan dan generasi pada mesin yang berbeda dengan menggunakan Storage Bucket bersama sebagai jembatan filesystem, menghilangkan kebutuhan akan NCCL atau komunikasi jaringan langsung antar node.

media Hugging Face Forums · 17 hari lalu · 29 tayangan

Studi mengidentifikasi FragileTokens yang gagal dalam penyalinan kontekstual meski lolos uji isolasi

Sebuah studi mengkarakterisasi "FragileTokens," entri kosakata dalam model bahasa bobot terbuka yang berhasil disalin saat terisolasi tetapi menunjukkan kesalahan ketika disisipkan ke dalam teks sekitarnya. Penelitian ini menyoroti bahwa pelestarian identitas literal tidak dijamin oleh uji isolasi standar, karena token dapat dihapus, diganti, atau dipotong di dalam urutan.

arxiv arXiv cs.AI · 22 hari lalu SWE-bench Verified · 72.6% · 31 tayangan

ExecCritic menggunakan RL khusus peran untuk meningkatkan agen pemrograman melalui perbaikan yang dipandu pengujian

ExecCritic memperkenalkan kerangka kerja yang memisahkan konstruksi pengujian dari perbaikan kode sumber untuk mencegah kepercayaan palsu pada agen pemrograman. Sistem ini menggunakan Agen Pengujian dan Agen Perbaikan, keduanya didukung oleh Qwen-3.5-35B-A3B, yang dilatih secara terpisah menggunakan pembelajaran penguatan.

arxiv arXiv cs.CL · 22 hari lalu SWE-bench Verified · 72.6% · 32 tayangan

ExecCritic menggunakan RL berbasis peran untuk meningkatkan agen pemrograman melalui perbaikan yang dipandu tes

Para peneliti memperkenalkan ExecCritic, sebuah kerangka kerja yang menggabungkan skafolding uji-verifikasi-revisi dengan pembelajaran penguatan berbasis peran untuk meningkatkan agen pemrograman. Sistem ini memisahkan konstruksi tes dari perbaikan kode sumber, menggunakan Agen Uji untuk menghasilkan tes asli repositori dan Agen Perbaikan untuk merevisi kode berdasarkan umpan balik eksekusi.