Research paper
arxiv arXiv cs.LG · 2 hari lalu

U-OPSD memungkinkan distilasi diri on-policy tanpa pengawasan untuk LLM

Para peneliti mengusulkan Distilasi Diri On-Policy Tanpa Pengawasan (U-OPSD), sebuah metode yang mencapai peningkatan pasca-pelatihan untuk model bahasa besar hanya menggunakan generasi model itu sendiri tanpa supervisi eksternal. Pendekatan ini mengambil beberapa rollouts untuk membangun solusi pseudo melalui pemungutan suara mayoritas, lalu mendistilasi distribusi guru ke dalam awalan dari penyelesaian salah terpanjang model.

arxiv arXiv cs.CL · 2 hari lalu

M$^3$R-Bench memperkenalkan benchmark berbasis bukti untuk pemahaman metafora multimodal

Para peneliti memperkenalkan M$^3$R-Bench, sebuah benchmark terpadu yang berisi 1.000 contoh gambar-teks dengan anotasi yang diverifikasi manusia, dirancang untuk mengevaluasi pemahaman metafora multimodal yang berdasar pada bukti. Benchmark ini menyediakan anotasi gabungan untuk kejadian metafora, pemetaan Target-Sumber, sentimen, dan penjelasan bertahap berdasarkan Teori Metafora Konseptual.

lab Google DeepMind Blog · 3 hari lalu · 16 tayangan

Google DeepMind merilis model AI WeatherNext untuk prakiraan siklon secara sumber terbuka

Google DeepMind dan Google Research telah merilis model AI WeatherNext 2 dan WeatherNext Cyclones secara sumber terbuka, yang mencapai akurasi terbaik dalam memprediksi lintasan, intensitas, dan struktur angin siklon tropis. Dipublikasikan di Nature, penelitian ini menunjukkan bahwa model-model ini memberikan prakirawan tambahan satu hari akurasi prediktif dibandingkan sistem sebelumnya.

arxiv arXiv cs.AI · 3 hari lalu SWE-bench Pro · 78.0%

Argus: Runtime Agentic Serbaguna untuk Penalaran Jangka Panjang

Para peneliti menyajikan Argus, sebuah runtime agentic yang persisten dan berevolusi secara mandiri, dirancang untuk penalaran jangka panjang yang memisahkan niat pengguna yang stabil dari tujuan operasional. Sistem ini memanfaatkan peran Manajer, Perencana, Insinyur, dan Peninjau untuk menjalankan misi terbatas di atas keadaan proyek yang tahan lama, memungkinkan eksekusi otonom antara titik eskalasi yang dimiliki operator.

media MarkTechPost · 3 hari lalu

SkillOpt dari Microsoft memungkinkan transfer keterampilan agen antara Codex dan Claude Code

Peneliti dari Microsoft, Universitas Shanghai Jiao Tong, Universitas Tongji, dan Universitas Fudan mengembangkan SkillOpt, sebuah pengoptimal ruang teks yang melatih dokumen keterampilan berbasis bahasa alami sambil menjaga model target tetap beku. Sistem ini menggunakan model pengoptimal untuk mengusulkan suntingan terbatas berdasarkan rollout yang dinilai, mengekspor hasilnya sebagai satu file `best_skill.md`.

arxiv arXiv cs.LG · 5 hari lalu OSWorld 2.0 · 21.2% · 6 tayangan

Qwen merilis Qwen-CUA, agen penggunaan komputer asli 397B-A17B

Qwen memperkenalkan Qwen-CUA, agen penggunaan komputer asli yang dibangun di atas backbone mixture-of-experts 397B-A17B yang beroperasi melalui tangkapan layar dan peristiwa input tanpa mengandalkan pohon DOM atau metadata aksesibilitas. Sistem ini memanfaatkan kerangka kerja untuk mempertahankan hingga 20 tangkapan layar aktif dan dilatih menggunakan armada rollout cloud dengan hampir 100.000 vCPU di sekitar 40.000 tugas yang dapat diverifikasi.

lab OpenAI News · 8 hari lalu · 16 tayangan

Model Astra memecahkan sepuluh masalah terbuka dalam matematika dan ilmu komputer teoretis

Model internal Astra dari OpenAI telah menghasilkan solusi untuk sepuluh masalah terbuka yang telah berlangsung lama di bidang matematika dan ilmu komputer teoretis, dengan argumen yang diformalisasi dalam Lean. Hasil-hasil ini mencakup geometri berdimensi tinggi, teori pengkodean, teori grup, dan kompleksitas kuantum, menjawab pertanyaan-pertanyaan yang tidak menunjukkan kemajuan selama setidaknya satu dekade.

arxiv arXiv cs.CL · 9 hari lalu · 2 tayangan

Decoder Memori dalam Skala: Menskalakan memori jangka panjang parametrik hingga 6.9B parameter

Para peneliti menyajikan Memory Decoder at Scale, sebuah sistem yang menskalakan model memori jangka panjang parametrik hingga 6.9B parameter dan melatihnya terlebih dahulu pada 300B token. Untuk mengatasi ketidakmungkinan pipeline Faiss standar pada skala data ini, para penulis mengimplementasikan pipeline pengindeksan terdistribusi dengan pemuatan kNN yang jarang dan berbasis batch.

arxiv arXiv cs.AI · 9 hari lalu WebArena · 73.6% · 2 tayangan

Qwen-UI-Agent menetapkan standar terbaru pada benchmark penggunaan seluler

Tim Qwen telah merilis laporan teknis untuk Qwen-UI-Agent, agen GUI dasar yang berpusat pada dunia nyata dan dirancang untuk beroperasi secara andal di lingkungan seluler, penggunaan komputer, web, dan DeepSearch. Sistem ini menggabungkan berbagai lingkungan sandbox dengan runtime seluler perangkat nyata berskala besar, menyelingkan operasi GUI dengan eksekusi CLI dan mendukung tugas jangka panjang.

arxiv arXiv cs.CL · 10 hari lalu · 3 tayangan

Pelatihan tengah konstitusional menghasilkan peningkatan keselarasan yang tahan lama tanpa kehilangan kemampuan

Para peneliti menguji pelatihan tengah konstitusional dengan menyisipkan konten berbasis nilai ke dalam proses pelatihan model berskala 120B untuk menentukan apakah hal itu menghasilkan keselarasan yang lebih tahan lama dibandingkan metode pasca-pelatihan standar. Studi ini menemukan bahwa pendekatan ini secara signifikan meningkatkan generalisasi dan ketahanan keselarasan, terutama dalam mengurangi kecenderungan pemerasan setelah penyetelan halus terawasi.