Sumber · arXiv cs.AI
arxiv arXiv cs.AI · 2 hari lalu · 1 tayangan

RareDx menggunakan optimasi kebijakan berbasis graf untuk meningkatkan diagnosis penyakit langka

Para penulis memperkenalkan RareDx, sebuah sistem yang menggabungkan penggunaan bukti terkontrol dengan optimasi kebijakan berbasis grafik pengetahuan untuk mengatasi masalah penalaran long-tail dalam diagnosis penyakit langka. Pipeline pelatihan menggabungkan Top-10 pasca-pelatihan dengan RareDx-KGPO, yang memproyeksikan prediksi ke dalam grafik penyakit kanonik dan mengintegrasikan relevansi bertingkat yang dikurasi, kedekatan ontologi, kesamaan biomedis, dan konsistensi fenotipe.

arxiv arXiv cs.AI · 3 hari lalu · 15 tayangan

Highlight-Then-Summarize memadatkan bukti untuk meningkatkan pemahaman konteks panjang

Para peneliti mengusulkan Highlight-Then-Summarize (H2S), sebuah paradigma kompresi-terus-alasan yang mengidentifikasi bukti relevan dengan pertanyaan dan mengintegrasikannya ke dalam ringkasan kompak sebelum menghasilkan jawaban. Tim membangun H2S-Dataset dengan 6.647 contoh dan memperkenalkan H2S-RL untuk memberikan imbalan tingkat proses untuk pemilihan bukti.

arxiv arXiv cs.AI · 6 hari lalu · 6 tayangan

GRASP memperkenalkan perencanaan multi-tahap yang sadar strategi untuk meningkatkan keandalan LLM

Para peneliti memperkenalkan GRASP, sebuah kerangka kerja perencanaan multi-tahap yang sadar strategi, dirancang untuk menghasilkan rencana eksekusi bahasa alami berkualitas tinggi untuk tugas kompleks di mana model Bahasa Besar standar biasanya mengalami penurunan keandalan. Sistem ini memisahkan pipa perencanaan menjadi modul-modul khusus: GenPlan untuk pedoman makro global, RevPlan untuk mengeksplorasi strategi terlokalisasi, dan VerPlan untuk evaluasi lintasan independen.

arxiv arXiv cs.AI · 7 hari lalu · 9 tayangan

Shanghai AI Lab merilis model dunia fisik InternW0 untuk interaksi dunia nyata yang efisien

Shanghai AI Laboratory telah memperkenalkan InternW0, instansiasi pertama dari seri model dunia fisik InternW-nya, yang dirancang untuk mempertahankan prediksi yang dapat ditindaklanjuti dalam lingkungan dinamis. Model ini secara bersama-sama mempelajari dinamika visual masa depan dan kontrol robot kontinu menggunakan arsitektur video-aksi asimetris dengan pencocokan aliran.

arxiv arXiv cs.AI · 8 hari lalu · 25 tayangan

AIDE^2 memungkinkan peningkatan diri secara rekursif pada agen penelitian AI

Para peneliti menyajikan AIDE^2, sebuah sistem yang mengimplementasikan siklus peningkatan diri secara rekursif untuk agen penelitian AI dengan mengoptimalkan kode internalnya sendiri. Sistem ini mengusulkan perubahan pada logika internalnya, melakukan benchmarking versi yang dimodifikasi pada tugas R&D AI, dan hanya mempertahankan peningkatan yang menunjukkan kinerja terbaik pada evaluasi tersembunyi.

arxiv arXiv cs.AI · 8 hari lalu WebArena · 45.3% · 26 tayangan

Growing Harness mengubah kontrol agen berulang menjadi kode yang dapat digunakan kembali melalui pelatihan yang dipandu oleh kegagalan

Para penulis memperkenalkan Growing Harness, sebuah paradigma pelatihan yang mempelajari struktur kontrol agen dari umpan balik tugas, bukan mengandalkan harness standar yang bergantung pada konteks. Dengan mengonversi keputusan kontrol berulang menjadi kode yang dapat dieksekusi dan membatasi panggilan LLM untuk penalaran semantik, metode ini bertujuan menciptakan agen spesialis yang dapat digunakan kembali.

arxiv arXiv cs.AI · 8 hari lalu · 22 tayangan

CliffCompaction mengurangi biaya agen pemrograman sebesar 50% sambil mempertahankan kinerja

Para peneliti memperkenalkan CliffCompaction, sebuah teknik autocompaction yang dirancang untuk mengurangi biaya bagi agen pemrograman jangka panjang hingga 50% dalam konteks terbatas. Metode ini mempertahankan atau meningkatkan kinerja pada Terminal-Bench dan mencapai hasil terbaik di KernelBench dengan menjaga informasi yang dikompresi tetap setia melalui pemotongan alih-alih parafrase.

arxiv arXiv cs.AI · 8 hari lalu · 17 tayangan

VideoX-Qwen memperkenalkan kerangka kerja berpusat pada data untuk pengeditan video berbasis instruksi

Peneliti mempersembahkan VideoX-Qwen, sebuah kerangka kerja terintegrasi yang menggabungkan konstruksi data yang dapat diskalakan dengan pelatihan model untuk memajukan pengeditan video tujuan umum yang digerakkan oleh instruksi. Sistem ini memanfaatkan pipeline produksi yang mengorganisir model khusus untuk menghasilkan catatan pengeditan arah, menghasilkan lebih dari 1,2 juta sampel berkualitas tinggi dalam tugas penambahan, penghapusan, penggantian, dan atribut.

arxiv arXiv cs.AI · 9 hari lalu HealthBench · 50.1% · 16 tayangan

Fathom-Vaidya meningkatkan penalaran medis dengan hadiah berbasis rubrik

Para penulis memperkenalkan Fathom-Vaidya, sebuah model 30B parameter yang menggunakan data sintetis dan pembelajaran penguatan berbasis rubrik untuk meningkatkan penalaran diagnostik dan klinis dalam perawatan kesehatan. Kerangka pelatihan pertama-tama menargetkan akurasi diagnostik menggunakan pertanyaan yang berasal dari MedBullets dan kemudian menangani interaksi klinis multi-giliran melalui 5,3k skenario yang dihasilkan dengan rubrik multidimensi.

arxiv arXiv cs.AI · 9 hari lalu · 16 tayangan

AgentRouter mengurangi biaya alur kerja agen sebesar 72% melalui penataan model per langkah

Para peneliti mengusulkan AgentRouter, sebuah klasifikator ringan yang mengoptimalkan alur kerja agen multi-langkah dengan menata langkah-langkah lintasan individu ke tingkat model yang sesuai, bukan menggunakan model terdepan untuk setiap tugas. Sistem ini mengatasi inefisiensi solusi yang ada yang mengabaikan kompleksitas sub-tugas yang bervariasi dalam satu sesi agen.

arxiv arXiv cs.AI · 10 hari lalu · 17 tayangan

NemotronLabs merilis VoiceChat, model obrolan suara dua arah penuh dengan panggilan alat

NemotronLabs telah memperkenalkan NemotronLabs VoiceChat, sebuah model obrolan suara dua arah penuh dengan bobot terbuka yang mengintegrasikan kemampuan panggilan alat asli dalam arsitektur streaming terpadu. Sistem ini menggabungkan encoder suara streaming dan model bahasa decoder-only dengan aliran output paralel untuk teks agen dan panggilan fungsi terstruktur, serta cabang RNN-T tambahan untuk transkripsi inkremental dan decoder TTS streaming.

arxiv arXiv cs.AI · 10 hari lalu · 24 tayangan

CodeMidas menskalakan lingkungan RL pemrograman agentic menggunakan kode sumber

Peneliti memperkenalkan CodeMidas, sebuah pipeline agentic yang membangun lingkungan pembelajaran penguatan dari fungsionalitas yang diimplementasikan dalam basis kode open-source, dengan menggunakan kode sumber sebagai satu-satunya input. Metode ini mengalokasikan komputasi agentic untuk mengeksplorasi fungsionalitas, membangun tes berbasis eksekusi, dan memvalidasi tugas melalui rollouts berulang, menghasilkan dataset berisi 5.545 tugas pelatihan di 23 bahasa pemrograman. Pelatihan MiMo-V2.5 pada tugas-tugas ini dengan GRPO meningkatkan kinerja pada lima benchmark beragam, termasuk DeepSWE (+11,7%), ProgramBench (+17%), dan Terminal-Bench v2.1 (+8,5%). Analisis trajektori menunjukkan bahwa agen yang dilatih dengan RL menampilkan perilaku yang lebih baik seperti eksplorasi basis kode yang lebih besar dan verifikasi diri yang lebih beragam. Hasil-hasil ini menetapkan kode sumber sebagai fondasi yang dapat diskalakan untuk membangun lingkungan RL yang meningkatkan agen pemrograman di berbagai tugas perangkat lunak.

arxiv arXiv cs.AI · 15 hari lalu · 27 tayangan

Pratinjau Atria Dawn: model bahasa agentic dasar untuk penelitian ilmiah

Atria Dawn Preview adalah model bahasa agentic dasar yang dirancang untuk alur kerja penelitian ilmiah dan teknik, dilatih melalui Pipelina Pengalaman Terverifikasi yang menghubungkan interaksi yang dimediasi alat ke lingkungan yang dapat dieksekusi. Di seluruh 16 benchmark yang mencakup penelitian dunia nyata, teknik, dan pekerjaan digital, model ini kompetitif dengan agen terdepan dan mencapai skor tertinggi yang dilaporkan pada lima di antaranya.