Lab · Zhipu AI
media MarkTechPost · 12 jam lalu · 2 tayangan

Z.ai merilis GLM-5.3 dengan peningkatan kemampuan coding dan keamanan siber melalui pasca-pelatihan

Z.ai telah merilis GLM-5.3, sebuah pembaruan untuk modelnya yang memiliki 743B parameter, yang mencapai peningkatan kinerja melalui skala pasca-pelatihan alih-alih pelatihan ulang model dasar. Rilis ini saat ini tersedia melalui API Z.ai, Paket Coding GLM, dan ZCode, dengan bobot publik dijadwalkan dirilis sekitar dua minggu setelah peluncuran setelah evaluasi keamanan.

arxiv arXiv cs.LG · 2 hari lalu HealthBench · 51.9% · 5 tayangan

Sistem RAG klinis VITA menyamai atau mengungguli LLM terdepan di HealthBench

Sebuah sistem generasi yang diperkaya dengan pengambilan kembali (RAG) yang dirancang khusus bernama VITA, yang ditujukan untuk pengaturan pendapatan rendah dan menengah, dievaluasi terhadap model bahasa besar tujuan umum pada benchmark HealthBench. Pada 4.023 pertanyaan yang dinilai oleh hakim GPT-4.1, VITA berada di peringkat pertama dengan 51,9% dari poin rubrik yang mungkin, melampaui GPT-5.4, o4-mini, Gemini 3.1 Pro, dan Claude Sonnet 4.6.

arxiv arXiv cs.LG · 4 hari lalu · 2 tayangan

Macaron-V1 memperkenalkan keluarga agen-model terbuka dengan Mixture-of-LoRA untuk pembelajaran berkelanjutan

Macaron-V1 adalah keluarga agen-model terbuka yang dirancang untuk kecerdasan eksperiensial, memungkinkan pembelajaran dari lingkungan nyata dan terus belajar setelah penyebaran. Sistem ini berfokus pada dua tujuan: adaptasi melalui perbaikan rekursif pasangan model-harness dan kolaborasi melalui arsitektur Mixture-of-LoRA (MoL) yang memilih adapter LoRA spesialis per giliran pengguna.

arxiv arXiv cs.CL · 4 hari lalu · 10 tayangan

Macaron-V1 memperkenalkan keluarga agen-model terbuka dengan Mixture-of-LoRA untuk pembelajaran berkelanjutan

Macaron-V1 adalah keluarga agen-model terbuka yang dirancang untuk kecerdasan eksperiensial, memungkinkan sistem belajar dari pengalaman dunia nyata dan terus meningkatkan diri setelah deployment. Arsitekturnya berpusat pada dua tujuan: adaptasi melalui perbaikan diri rekursif pasangan model-harness, dan kolaborasi melalui sistem Mixture-of-LoRA (MoL) yang memilih adapter spesialis per giliran pengguna.

arxiv arXiv cs.CL · 15 hari lalu · 4 tayangan

OSReward memperkenalkan evaluasi terstandarisasi untuk model hadiah penggunaan komputer lintas platform

Para peneliti memperkenalkan OSReward, sebuah benchmark realistis yang dirancang untuk mengevaluasi keandalan model visi-bahasa (VLM) yang bertindak sebagai hakim untuk lintasan agen penggunaan komputer. Studi ini mengungkapkan bahwa bahkan VLM mutakhir pun mengalami bias kemurahan hati sistematis dan sering kali terlalu mahal untuk skala besar, sementara model terbuka yang terjangkau kinerjanya buruk.

media TLDR AI · 16 hari lalu · 34 tayangan

xAI luncurkan Mode Build; peneliti mendesak perjanjian perlambatan AI

xAI telah meluncurkan "Mode Build" untuk pelanggan SuperGrok Heavy, memungkinkan pengguna membuat, mengedit, pratinjau, dan menerbitkan situs web, aplikasi, game, dan dasbor langsung dari obrolan tanpa perlu pengaturan. Secara bersamaan, lebih dari seribu karyawan dari perusahaan AI terdepan telah menandatangani pernyataan yang meminta pemerintah AS mendukung upaya internasional untuk mengembangkan alat guna secara sengaja mengatur kecepatan pengembangan AI terdepan.

arxiv arXiv cs.CL · 18 hari lalu · 3 tayangan

PIVOT berbagi pemindaian awalan di seluruh grup kueri untuk mempercepat perhatian sparse tingkat token

PIVOT (Proxy Indexing Via One full-prefix Traversal) adalah pengganti langsung tanpa pelatihan untuk pengindeks DeepSeek Sparse Attention (DSA) yang mengurangi redundansi komputasi dengan membagikan satu pemindaian awalan di sekelompok kueri terdekat. Alih-alih memberi skor setiap token pendahulu untuk setiap kueri secara individual, PIVOT menggabungkan grup menjadi satu kueri proksi untuk mendapatkan kumpulan kandidat, dari mana top-k token dipilih untuk setiap kueri.

arxiv arXiv cs.CL · 18 hari lalu · 2 tayangan

Kerangka kerja Zing meningkatkan kecerdasan sosial LLM melalui benchmark SoMBench dan penjangkaran Actio

Laporan ini memperkenalkan Zing, sebuah kerangka kerja terintegrasi yang dirancang untuk meningkatkan kecerdasan sosial model bahasa besar dengan mengukur, menginternalisasi, dan menjangkarkan kemampuan sosial. Para penulis menyajikan SoMBench, sebuah benchmark berbasis psikologi yang mencakup 17 dimensi sekunder dan 3.481 contoh yang diverifikasi oleh ahli, yang mengungkapkan bahwa LLM saat ini masih memiliki ruang perbaikan signifikan tanpa ada model yang mencapai kinerja hampir maksimal.