Sumber · arXiv cs.CL
arxiv arXiv cs.CL · 20 jam lalu

Pengurangan Perkalian Matriks: Reduksi Produk-Matriks Adaptif-Input untuk Inferensi LLM

Para peneliti mengusulkan Pengurangan Perkalian Matriks (RMM), metode inferensi adaptif-input tanpa pelatihan yang mengurangi produk matriks Transformer dengan memilih irisan informatif sepanjang dimensi kontraksi tanpa memodifikasi bobot model. Di bawah kontrol rasio retensi yang sederhana, RMM memberikan trade-off akurasi-efisiensi yang halus dan dapat diprediksi di seluruh model bahasa mulai dari 1B hingga 70B parameter.

arxiv arXiv cs.CL · 3 hari lalu · 1 tayangan

MiLMMT-46-v1.0 meningkatkan terjemahan multibahasa melalui pasca-pelatihan tanpa referensi

Para peneliti telah merilis MiLMMT-46-v1.0, sebuah model bahasa besar sumber terbuka untuk terjemahan mesin multibahasa yang memanfaatkan pasca-pelatihan tanpa referensi. Dimulai dari MiLMMT-46-v0.1 yang telah disetel halus secara terawasi, tim menerapkan Group Relative Policy Optimization (GRPO) dengan imbalan berdasarkan dua model estimasi kualitas tanpa referensi yang dikendalikan oleh identifikasi bahasa.

arxiv arXiv cs.CL · 4 hari lalu · 10 tayangan

Macaron-V1 memperkenalkan keluarga agen-model terbuka dengan Mixture-of-LoRA untuk pembelajaran berkelanjutan

Macaron-V1 adalah keluarga agen-model terbuka yang dirancang untuk kecerdasan eksperiensial, memungkinkan sistem belajar dari pengalaman dunia nyata dan terus meningkatkan diri setelah deployment. Arsitekturnya berpusat pada dua tujuan: adaptasi melalui perbaikan diri rekursif pasangan model-harness, dan kolaborasi melalui sistem Mixture-of-LoRA (MoL) yang memilih adapter spesialis per giliran pengguna.

arxiv arXiv cs.CL · 5 hari lalu · 8 tayangan

GPT-5 dan GPT-5 Nano setara dengan pakar dalam ekstraksi bukti onkogenesis mikroba

Sebuah studi yang membandingkan model bahasa besar pada sintesis bukti sistematis untuk onkogenesis mikroba menemukan bahwa GPT-5 dan GPT-5 Nano berkinerja tak terbedakan dari pakar domain. Para peneliti mengevaluasi Gemini 2.5 Pro, Gemini 2.5 Flash, GPT-5, dan GPT-5 Nano pada 24 makalah penelitian menggunakan templat terstruktur berisi 77 item di berbagai jenis pertanyaan.

arxiv arXiv cs.CL · 8 hari lalu · 4 tayangan

M$^3$R-Bench memperkenalkan benchmark berbasis bukti untuk pemahaman metafora multimodal

Para peneliti memperkenalkan M$^3$R-Bench, sebuah benchmark terpadu yang berisi 1.000 contoh gambar-teks dengan anotasi yang diverifikasi manusia, dirancang untuk mengevaluasi pemahaman metafora multimodal yang berdasar pada bukti. Benchmark ini menyediakan anotasi gabungan untuk kejadian metafora, pemetaan Target-Sumber, sentimen, dan penjelasan bertahap berdasarkan Teori Metafora Konseptual.

arxiv arXiv cs.CL · 15 hari lalu · 4 tayangan

Decoder Memori dalam Skala: Menskalakan memori jangka panjang parametrik hingga 6.9B parameter

Para peneliti menyajikan Memory Decoder at Scale, sebuah sistem yang menskalakan model memori jangka panjang parametrik hingga 6.9B parameter dan melatihnya terlebih dahulu pada 300B token. Untuk mengatasi ketidakmungkinan pipeline Faiss standar pada skala data ini, para penulis mengimplementasikan pipeline pengindeksan terdistribusi dengan pemuatan kNN yang jarang dan berbasis batch.

arxiv arXiv cs.CL · 15 hari lalu MLE-bench · 71.21% · 3 tayangan

Frontis-MA1 mencapai MLE state-of-the-art melalui peningkatan diri rekursif OpenMLE

Frontis merilis Frontis-MA1, model AI4AI dengan 35B parameter yang dirancang untuk peningkatan diri rekursif dalam teknik mesin pembelajaran, bersama tumpukan sumber terbuka OpenMLE. Sistem ini mengintegrasikan lingkungan tugas yang dapat diverifikasi, pembelajaran operator, dan pencarian jangka panjang untuk memungkinkan agen meningkatkan kodenya sendiri melalui pelatihan berbasis eksekusi.

arxiv arXiv cs.CL · 15 hari lalu · 4 tayangan

OSReward memperkenalkan evaluasi terstandarisasi untuk model hadiah penggunaan komputer lintas platform

Para peneliti memperkenalkan OSReward, sebuah benchmark realistis yang dirancang untuk mengevaluasi keandalan model visi-bahasa (VLM) yang bertindak sebagai hakim untuk lintasan agen penggunaan komputer. Studi ini mengungkapkan bahwa bahkan VLM mutakhir pun mengalami bias kemurahan hati sistematis dan sering kali terlalu mahal untuk skala besar, sementara model terbuka yang terjangkau kinerjanya buruk.

arxiv arXiv cs.CL · 16 hari lalu · 3 tayangan

Pelatihan tengah konstitusional menghasilkan peningkatan keselarasan yang tahan lama tanpa kehilangan kemampuan

Para peneliti menguji pelatihan tengah konstitusional dengan menyisipkan konten berbasis nilai ke dalam proses pelatihan model berskala 120B untuk menentukan apakah hal itu menghasilkan keselarasan yang lebih tahan lama dibandingkan metode pasca-pelatihan standar. Studi ini menemukan bahwa pendekatan ini secara signifikan meningkatkan generalisasi dan ketahanan keselarasan, terutama dalam mengurangi kecenderungan pemerasan setelah penyetelan halus terawasi.

arxiv arXiv cs.CL · 17 hari lalu · 1 tayangan

Relay-OPD mengurangi panjang lintasan pelatihan lebih dari 50% dalam distilasi on-policy

Para peneliti memperkenalkan Relay On-Policy Distillation (Relay-OPD) untuk mengatasi kegagalan prefix dalam distilasi on-policy standar, di mana kesalahan siswa menyebabkan pengawasan yang tidak dapat diandalkan. Metode ini menggunakan asimetri kelanjutan guru-siswa sebagai pemicu bagi guru untuk sebentar mengambil alih dan mengarahkan ulang lintasan sebelum siswa melanjutkan.

arxiv arXiv cs.CL · 18 hari lalu · 3 tayangan

PIVOT berbagi pemindaian awalan di seluruh grup kueri untuk mempercepat perhatian sparse tingkat token

PIVOT (Proxy Indexing Via One full-prefix Traversal) adalah pengganti langsung tanpa pelatihan untuk pengindeks DeepSeek Sparse Attention (DSA) yang mengurangi redundansi komputasi dengan membagikan satu pemindaian awalan di sekelompok kueri terdekat. Alih-alih memberi skor setiap token pendahulu untuk setiap kueri secara individual, PIVOT menggabungkan grup menjadi satu kueri proksi untuk mendapatkan kumpulan kandidat, dari mana top-k token dipilih untuk setiap kueri.