Sumber · arXiv cs.LG
arxiv arXiv cs.LG · 18 hari lalu · 3 tayangan

Moonshot AI merilis Kimi K3, model MoE 2.8T parameter dengan konteks jutaan token

Moonshot AI telah memperkenalkan Kimi K3, model Mixture-of-Experts sumber terbuka yang memiliki total 2,8 triliun parameter dan 104 miliar parameter aktif per token. Model ini mendukung kemampuan visi asli dan jendela konteks 1 juta token, memanfaatkan Kimi Delta Attention dan Stable LatentMoE untuk mencapai efisiensi penskalaan sekitar 2,5x dibandingkan pendahulunya, Kimi K2.

arxiv arXiv cs.LG · 2 hari lalu HealthBench · 51.9% · 5 tayangan

Sistem RAG klinis VITA menyamai atau mengungguli LLM terdepan di HealthBench

Sebuah sistem generasi yang diperkaya dengan pengambilan kembali (RAG) yang dirancang khusus bernama VITA, yang ditujukan untuk pengaturan pendapatan rendah dan menengah, dievaluasi terhadap model bahasa besar tujuan umum pada benchmark HealthBench. Pada 4.023 pertanyaan yang dinilai oleh hakim GPT-4.1, VITA berada di peringkat pertama dengan 51,9% dari poin rubrik yang mungkin, melampaui GPT-5.4, o4-mini, Gemini 3.1 Pro, dan Claude Sonnet 4.6.

arxiv arXiv cs.LG · 4 hari lalu · 2 tayangan

Macaron-V1 memperkenalkan keluarga agen-model terbuka dengan Mixture-of-LoRA untuk pembelajaran berkelanjutan

Macaron-V1 adalah keluarga agen-model terbuka yang dirancang untuk kecerdasan eksperiensial, memungkinkan pembelajaran dari lingkungan nyata dan terus belajar setelah penyebaran. Sistem ini berfokus pada dua tujuan: adaptasi melalui perbaikan rekursif pasangan model-harness dan kolaborasi melalui arsitektur Mixture-of-LoRA (MoL) yang memilih adapter LoRA spesialis per giliran pengguna.

arxiv arXiv cs.LG · 4 hari lalu · 11 tayangan

Peneliti mengeksploitasi penggunaan ulang enkripsi lintas sesi untuk mencuri jejak penalaran dari API LLM

Para peneliti telah mengidentifikasi kerentanan dalam cara penyedia model bahasa besar terkemuka menangani jejak penalaran bertahap, yang dikembalikan sebagai blok terenkripsi untuk penggunaan sisi klien. Mereka menemukan bahwa blok-blok terenkripsi ini sepenuhnya kompatibel dan dapat dipertukarkan di seluruh sesi, pengguna, dan model yang berbeda dalam ekosistem penyedia yang sama.

arxiv arXiv cs.LG · 8 hari lalu

U-OPSD memungkinkan distilasi diri on-policy tanpa pengawasan untuk LLM

Para peneliti mengusulkan Distilasi Diri On-Policy Tanpa Pengawasan (U-OPSD), sebuah metode yang mencapai peningkatan pasca-pelatihan untuk model bahasa besar hanya menggunakan generasi model itu sendiri tanpa supervisi eksternal. Pendekatan ini mengambil beberapa rollouts untuk membangun solusi pseudo melalui pemungutan suara mayoritas, lalu mendistilasi distribusi guru ke dalam awalan dari penyelesaian salah terpanjang model.

arxiv arXiv cs.LG · 11 hari lalu OSWorld 2.0 · 21.2% · 20 tayangan

Qwen merilis Qwen-CUA, agen penggunaan komputer asli 397B-A17B

Qwen memperkenalkan Qwen-CUA, agen penggunaan komputer asli yang dibangun di atas backbone mixture-of-experts 397B-A17B yang beroperasi melalui tangkapan layar dan peristiwa input tanpa mengandalkan pohon DOM atau metadata aksesibilitas. Sistem ini memanfaatkan kerangka kerja untuk mempertahankan hingga 20 tangkapan layar aktif dan dilatih menggunakan armada rollout cloud dengan hampir 100.000 vCPU di sekitar 40.000 tugas yang dapat diverifikasi.

arxiv arXiv cs.LG · 24 hari lalu · 8 tayangan

SkewAdam menggunakan keadaan pengoptimum bertingkat untuk mengurangi memori pelatihan MoE sebesar 97%

Para peneliti memperkenalkan SkewAdam, sebuah pengoptimum yang dirancang untuk model campuran-ahli (MoE) yang mengalokasikan jenis keadaan berbeda ke populasi parameter yang berbeda guna secara drastis mengurangi penggunaan memori. Dengan menetapkan momentum float32 dan momen kedua terfaktor pada tulang punggung, momen kedua terfaktor pada ahli, dan momen kedua tepat pada perute, SkewAdam mengurangi keadaan pengoptimum dari 50,6 GB menjadi 1,29 GB untuk model dengan 6,78B parameter.