Research paper
arxiv arXiv cs.AI · 2 jam lalu · 9 tayangan

AIDE^2 memungkinkan peningkatan diri secara rekursif pada agen penelitian AI

Para peneliti menyajikan AIDE^2, sebuah sistem yang mengimplementasikan siklus peningkatan diri secara rekursif untuk agen penelitian AI dengan mengoptimalkan kode internalnya sendiri. Sistem ini mengusulkan perubahan pada logika internalnya, melakukan benchmarking versi yang dimodifikasi pada tugas R&D AI, dan hanya mempertahankan peningkatan yang menunjukkan kinerja terbaik pada evaluasi tersembunyi.

arxiv arXiv cs.AI · 3 jam lalu WebArena · 45.3% · 13 tayangan

Growing Harness mengubah kontrol agen berulang menjadi kode yang dapat digunakan kembali melalui pelatihan yang dipandu oleh kegagalan

Para penulis memperkenalkan Growing Harness, sebuah paradigma pelatihan yang mempelajari struktur kontrol agen dari umpan balik tugas, bukan mengandalkan harness standar yang bergantung pada konteks. Dengan mengonversi keputusan kontrol berulang menjadi kode yang dapat dieksekusi dan membatasi panggilan LLM untuk penalaran semantik, metode ini bertujuan menciptakan agen spesialis yang dapat digunakan kembali.

arxiv arXiv cs.LG · 4 jam lalu · 11 tayangan

AIDE^2 memungkinkan peningkatan diri secara rekursif pada agen riset AI

Para peneliti menyajikan AIDE^2, sebuah sistem yang mengimplementasikan siklus peningkatan diri secara rekursif untuk agen riset AI terdepan dengan mengoptimalkan kode internalnya sendiri. Sistem ini mengusulkan perubahan pada logika internalnya, melakukan benchmarking versi yang dimodifikasi pada tugas-tugas R&D AI, dan hanya mempertahankan pembaruan yang berkinerja terbaik pada evaluasi tersembunyi.

arxiv arXiv cs.CL · 7 jam lalu · 11 tayangan

TelecomGPT-R1: Pelatihan Pasca-Unifikasi untuk Penalaran Melintasi Tugas Telekomunikasi Heterogen

Para peneliti memperkenalkan TelecomGPT-R1, sebuah keluarga model penalaran telekomunikasi terpadu sumber terbuka yang dirancang untuk mengotomatisasi tugas teknik dengan menalar atas standar, konfigurasi, dan log. Model ini mengatasi keterbatasan LLM umum dan khusus yang ada melalui pendekatan terstruktur yang mencakup aspek protokol, pengetahuan, pemodelan, dan gangguan.

arxiv arXiv cs.LG · 1 hari lalu HealthBench · 50.1% · 10 tayangan

Fathom-Vaidya meningkatkan penalaran medis dengan hadiah berbasis rubrik

Para penulis memperkenalkan Fathom-Vaidya, model 30B parameter yang menggunakan data sintetis dan pembelajaran penguatan berbasis rubrik untuk meningkatkan penalaran diagnostik dan klinis dalam perawatan kesehatan. Kerangka pelatihan pertama-tama menerapkan RL yang dipandu aturan pada pertanyaan yang berasal dari MedBullets untuk diagnosis, kemudian memanfaatkan 5.3k skenario multi-giliran sintetis dengan rubrik multidimensi untuk tugas klinis interaktif.

arxiv arXiv cs.AI · 1 hari lalu HealthBench · 50.1% · 12 tayangan

Fathom-Vaidya meningkatkan penalaran medis dengan hadiah berbasis rubrik

Para penulis memperkenalkan Fathom-Vaidya, sebuah model 30B parameter yang menggunakan data sintetis dan pembelajaran penguatan berbasis rubrik untuk meningkatkan penalaran diagnostik dan klinis dalam perawatan kesehatan. Kerangka pelatihan pertama-tama menargetkan akurasi diagnostik menggunakan pertanyaan yang berasal dari MedBullets dan kemudian menangani interaksi klinis multi-giliran melalui 5,3k skenario yang dihasilkan dengan rubrik multidimensi.

lab Microsoft Research Blog · 2 hari lalu · 29 tayangan

Microsoft merilis RetroChimera untuk prediksi retrosintesis

Microsoft Research telah menerbitkan dan membuka sumber RetroChimera, sebuah kerangka kerja baru untuk prediksi retrosintesis yang menggabungkan dua model komplementer untuk mengusulkan rute sintesis berkualitas tinggi. Sistem ini mengintegrasikan R-SMILES 2, model de-novo berbasis Transformer, dengan NeuralLoc, model berbasis jaringan saraf graf (GNN), menggunakan strategi ensembling terlatih untuk meranking prediksi.

arxiv arXiv cs.AI · 2 hari lalu · 18 tayangan

CodeMidas menskalakan lingkungan RL pemrograman agentic menggunakan kode sumber

Peneliti memperkenalkan CodeMidas, sebuah pipeline agentic yang membangun lingkungan pembelajaran penguatan dari fungsionalitas yang diimplementasikan dalam basis kode open-source, dengan menggunakan kode sumber sebagai satu-satunya input. Metode ini mengalokasikan komputasi agentic untuk mengeksplorasi fungsionalitas, membangun tes berbasis eksekusi, dan memvalidasi tugas melalui rollouts berulang, menghasilkan dataset berisi 5.545 tugas pelatihan di 23 bahasa pemrograman. Pelatihan MiMo-V2.5 pada tugas-tugas ini dengan GRPO meningkatkan kinerja pada lima benchmark beragam, termasuk DeepSWE (+11,7%), ProgramBench (+17%), dan Terminal-Bench v2.1 (+8,5%). Analisis trajektori menunjukkan bahwa agen yang dilatih dengan RL menampilkan perilaku yang lebih baik seperti eksplorasi basis kode yang lebih besar dan verifikasi diri yang lebih beragam. Hasil-hasil ini menetapkan kode sumber sebagai fondasi yang dapat diskalakan untuk membangun lingkungan RL yang meningkatkan agen pemrograman di berbagai tugas perangkat lunak.

media Hugging Face Forums · 3 hari lalu · 16 tayangan

Peneliti mencari satu penilai independen untuk menyelesaikan ambiguitas kesepakatan LLM

Seorang peneliti meminta seorang manusia penilai independen tunggal untuk memberi label pada 100 adegan naratif Turki guna menentukan apakah rendahnya kesepakatan antar-penilai berasal dari sifat interpretatif tugas atau dari definisi anotasi yang kurang spesifik. Studi ini menemukan bahwa empat LLM dan sebuah detektor berbasis aturan sepakat satu sama lain serta dengan referensi manusia pada tingkat kira-kira acak, dengan skor Cohen’s κ berkisar dari 0,000 hingga 0,185.

media Hugging Face Forums · 3 hari lalu · 17 tayangan

GlucoEdge: prakiraan tren glukosa di perangkat dengan kuantisasi INT8

Peneliti independen Mohamed Menasy telah menerbitkan GlucoEdge, sebuah studi rekayasa yang merinci alur kerja machine learning end-to-end di perangkat untuk prakiraan tren glukosa lima kelas selama 15 menit dari data monitor glukosa kontinu. Karya ini memperkenalkan CNN 1D ringkas yang hanya memiliki 2.909 parameter dan mencakup seluruh alur kerja dari konversi PyTorch ke LiteRT.

arxiv arXiv cs.LG · 7 hari lalu · 20 tayangan

OpenAI merilis Open-1B dengan pelatihan yang sepenuhnya dapat diaudit

OpenAI telah merilis Open-1B, sebuah model bahasa yang dilatih di bawah rezim di mana setiap operasi selama pelatihan dapat direproduksi secara independen pada perangkat keras komersial heterogen dengan kepastian bit demi bit. Pendekatan ini mengatasi masalah reproduktibilitas yang melekat pada model sumber terbuka dengan memberlakukan urutan tertentu pada sumber non-determinisme, seperti reduksi kernel GPU dan pengurutan batch data.

arxiv arXiv cs.AI · 8 hari lalu · 24 tayangan

Pratinjau Atria Dawn: model bahasa agentic dasar untuk penelitian ilmiah

Atria Dawn Preview adalah model bahasa agentic dasar yang dirancang untuk alur kerja penelitian ilmiah dan teknik, dilatih melalui Pipelina Pengalaman Terverifikasi yang menghubungkan interaksi yang dimediasi alat ke lingkungan yang dapat dieksekusi. Di seluruh 16 benchmark yang mencakup penelitian dunia nyata, teknik, dan pekerjaan digital, model ini kompetitif dengan agen terdepan dan mencapai skor tertinggi yang dilaporkan pada lima di antaranya.