Sumber · arXiv cs.AI
arxiv arXiv cs.AI · 2 hari lalu · 3 tayangan

SCUT meningkatkan penalaran spasial pada VLM melalui CoT terstruktur dan RL proses-supervised

Para peneliti mengusulkan SCOUT, sebuah kerangka kerja yang meningkatkan penalaran spasial Model Bahasa-Gambar dengan menggabungkan Chain-of-Thought terstruktur dengan pembelajaran penguatan reward proses multi-tujuan. Pendekatan ini mengatasi masalah penugasan kredit pada metode RL yang ada dan mengintegrasikan persepsi kedalaman untuk pemahaman 3D yang komprehensif.

arxiv arXiv cs.AI · 2 hari lalu HealthBench · 51.9% · 4 tayangan

RAG klinis VITA menyamai atau mengungguli LLM terdepan pada HealthBench

Sebuah sistem retrieval-augmented generation yang dirancang khusus bernama VITA, yang ditujukan untuk negara berpenghasilan rendah dan menengah, dievaluasi terhadap model bahasa besar umum pada benchmark HealthBench. Studi ini menunjukkan bahwa desain yang spesifik terhadap korpus dapat mempertahankan kinerja kompetitif meskipun model terdepan baru terus dirilis.

arxiv arXiv cs.AI · 4 hari lalu

Optimisasi Terbuka Memungkinkan GPT-5.5 menyusun proses perbaikannya sendiri

Artikel ini memperkenalkan Optimisasi Terbuka (OEO), sebuah kerangka kerja yang memungkinkan pengoptimal model terdepan untuk secara dinamis menyusun proses perbaikannya secara daring, alih-alih mengandalkan pipa optimasi yang telah ditentukan. Para penulis membandingkan OEO dengan dua pendekatan bertahap, SkillOpt dan GEPA, di seluruh 14 perbandingan langsung atas delapan pengaturan target-model benchmark.

arxiv arXiv cs.AI · 4 hari lalu

AMIE (Video) mencapai kinerja tingkat ahli dalam konsultasi medis real-time

Para peneliti telah mendemonstrasikan sistem AI tingkat ahli pertama untuk konsultasi video klinis real-time menggunakan AMIE (Video), sebuah sistem multi-agen berbasis Gemini yang mengintegrasikan dialog latensi rendah dengan persepsi audio-visual real-time. Dalam studi Pemeriksaan Klinis Terstruktur Objektif acak yang melibatkan 30 dokter perawatan primer dan 100 skenario, evaluator klinis menilai sistem setara atau lebih baik daripada dokter dalam pengambilan riwayat, diagnosis, manajemen, dan observasi fisik.

arxiv arXiv cs.AI · 4 hari lalu · 17 tayangan

Penyerang mencuri jejak penalaran dari API LLM tertutup melalui kerentanan blok terenkripsi

Para peneliti telah mengidentifikasi kerentanan arsitektural dalam cara penyedia model bahasa besar terkemuka menangani jejak penalaran langkah demi langkah. Penyedia mengembalikan jejak ini sebagai blok terenkripsi ke klien, namun studi menemukan bahwa blok-blok tersebut sepenuhnya kompatibel dan dapat dipertukarkan antar sesi, pengguna, dan model yang berbeda dalam ekosistem penyedia.

arxiv arXiv cs.AI · 5 hari lalu · 12 tayangan

GPT-5 dan GPT-5 Nano menyamai para ahli dalam penilaian penelitian onkogenesis mikroba

Sebuah studi menunjukkan bahwa GPT-5 dan GPT-5 Nano mencapai kinerja tingkat ahli dalam mengekstrak bukti dan melakukan penilaian kritis terhadap publikasi penelitian mengenai onkogenesis mikroba. Para peneliti membandingkan model-model ini bersama Gemini 2.5 Pro dan Gemini 2.5 Flash dengan para ahli domain menggunakan dataset yang terdiri dari 24 makalah yang berfokus pada MMTV-LV dan kanker payudara.

arxiv arXiv cs.AI · 9 hari lalu SWE-bench Pro · 78.0% · 1 tayangan

Argus: Runtime Agentic Serbaguna untuk Penalaran Jangka Panjang

Para peneliti menyajikan Argus, sebuah runtime agentic yang persisten dan berevolusi secara mandiri, dirancang untuk penalaran jangka panjang yang memisahkan niat pengguna yang stabil dari tujuan operasional. Sistem ini memanfaatkan peran Manajer, Perencana, Insinyur, dan Peninjau untuk menjalankan misi terbatas di atas keadaan proyek yang tahan lama, memungkinkan eksekusi otonom antara titik eskalasi yang dimiliki operator.

arxiv arXiv cs.AI · 9 hari lalu

SciCode-Verified memperbaiki cacat benchmark untuk mengungkap kemampuan pemrograman ilmiah sejati model

Para penulis mengidentifikasi bahwa skor yang stagnan pada benchmark SciCode berasal dari cacat signifikan dalam instrumen evaluasi, bukan dari keterbatasan kemampuan model. Audit oleh pakar domain terhadap 65 soal pengujian menemukan 263 cacat, dengan 192 di antaranya menyebabkan solusi yang benar ditolak secara keliru karena masalah seperti jawaban acuan yang tidak dapat direproduksi dan toleransi yang terlalu ketat.

arxiv arXiv cs.AI · 10 hari lalu

Video-DeepResearch memperkenalkan agen multimodal untuk aliran video berkelanjutan

Para peneliti memperkenalkan Video-DeepResearch (Video-DR), sebuah kerangka kerja yang memperluas agen multimodal dari gambar statis ke aliran video berkelanjutan, dengan mengatasi bias modalitas dan kebocoran pengetahuan parametrik. Sistem ini menggunakan pipa persepsi-penjelajahan yang terdekoupling dengan pembukaan alat bertahap untuk memaksakan penjangkaran visual lintas frame sebelum pengambilan web.

arxiv arXiv cs.AI · 15 hari lalu WebArena · 73.6% · 4 tayangan

Qwen-UI-Agent menetapkan standar terbaru pada benchmark penggunaan seluler

Tim Qwen telah merilis laporan teknis untuk Qwen-UI-Agent, agen GUI dasar yang berpusat pada dunia nyata dan dirancang untuk beroperasi secara andal di lingkungan seluler, penggunaan komputer, web, dan DeepSearch. Sistem ini menggabungkan berbagai lingkungan sandbox dengan runtime seluler perangkat nyata berskala besar, menyelingkan operasi GUI dengan eksekusi CLI dan mendukung tugas jangka panjang.

arxiv arXiv cs.AI · 18 hari lalu · 1 tayangan

ClinFusion memperkenalkan MLLM berpusat visi untuk pemahaman medis holistik

Para peneliti memperkenalkan ClinFusion, model bahasa besar multimodal berpusat visi yang dirancang untuk mengatasi tantangan penerapan AI dalam praktik klinis dengan menyatukan pemahaman gambar medis 2D dan 3D. Sistem ini memiliki pengkode visi kaskade komposisional dengan operator Fusi Lokalitas Berpenuh Spasial Kaskade dan mencakup kerangka evaluasi baru yang terdiri dari MedIF-Bench serta metrik berbasis wilayah minat.

arxiv arXiv cs.AI · 18 hari lalu

Modul Kelayakan Aethis menggunakan arsitektur neuro-simbolik untuk memperbaiki kesalahan evaluasi aturan LLM

Artikel ini mendokumentasikan kelas kegagalan dalam model bahasa besar terdepan yang disebut keruntuhan rantai pengecualian, di mana model mengevaluasi aturan kondisional bersarang secara salah. Untuk mengatasi hal ini, para penulis menyajikan Modul Kelayakan Aethis, sebuah arsitektur neuro-simbolik yang menggabungkan aturan yang ditulis oleh LLM dengan lapisan berbasis SMT untuk eksekusi deterministik.

arxiv arXiv cs.AI · 22 hari lalu OSWorld · 37.7% · 5 tayangan

OpenForgeRL memungkinkan pelatihan end-to-end agen berbasis harness di lingkungan apa pun

OpenForgeRL adalah kerangka kerja sumber terbuka yang memungkinkan peneliti melatih agen AI berbasis harness secara end-to-end menggunakan tumpukan pembelajaran penguatan standar. Hal ini dicapai dengan memisahkan pelatihan dari inferensi melalui proksi ringan yang merekam panggilan model sebagai data dan orkestrator Kubernetes yang mengelola peluncuran kontainer jarak jauh.

arxiv arXiv cs.AI · 22 hari lalu · 4 tayangan

AREX memperkenalkan agen riset mendalam yang secara rekursif meningkatkan diri sendiri

Para peneliti memperkenalkan AREX, sebuah keluarga agen riset mendalam Recursively Self-Improving (RSI) yang dirancang untuk mengatasi asimetri antara penemuan dan verifikasi dalam kueri kompleks. AREX bergantian antara loop internal yang mengumpulkan bukti dan membangun jawaban sementara, serta loop eksternal yang mengaudit batasan untuk memandu penyempurnaan terarah.

arxiv arXiv cs.AI · 23 hari lalu · 4 tayangan

SLAI T-Rex memungkinkan pelatihan pasca-pelatihan parameter penuh DeepSeek-V4 di Ascend SuperPOD

SLAI memperkenalkan T-Rex, sebuah kerangka kerja optimasi end-to-end untuk pelatihan pasca-pelatihan parameter penuh model MoE berskala triliun parameter di Ascend NPU SuperPOD. Menggunakan keluarga model DeepSeek-V4 sebagai beban kerja target, sistem ini mengatasi tekanan memori dan overhead komunikasi melalui paralelisme hierarkis dan optimasi eksekusi kernel.