Topik · Benchmark results
media AI News (smol.ai) · 10 hari lalu Terminal-Bench 2 · 67.4% · 21 tayangan

Alibaba mengumumkan Qwen3.8-Max dengan 2.4T parameter dan bobot terbuka yang akan datang

Alibaba telah mengumumkan Qwen3.8-Max sebagai model andalan barunya, menggambarkannya sebagai arsitektur sparse 2.4T-parameter yang berfokus pada pekerjaan agentic jangka panjang, pemrograman, dan penalaran multimodal. Perusahaan mengonfirmasi bahwa bobot terbuka untuk Qwen3.8-Max akan dirilis minggu depan bersama varian open-weight Qwen3.8-27B.

media Together AI Blog · 21 hari lalu · 8 tayangan

Kimi K3 menyamai Claude Fable 5 pada kualitas DeepSWE dengan biaya sepertiga

Kimi K3, model berbobot terbuka dari Moonshot AI, mencapai kinerja yang sebanding dengan Claude Fable 5 dari Anthropic pada benchmark DeepSWE sambil membutuhkan biaya jauh lebih sedikit per tugas. Dalam evaluasi tanggal 16 Juli 2026, Kimi K3 mencapai pass@1 sebesar 68,5% dibandingkan 69,9% untuk Fable 5, namun mengunggulinya dalam skenario multi-percobaan dan menawarkan efisiensi biaya yang lebih unggul.

arxiv τ²-bench (tau2-bench) · 23 hari lalu · 3 tayangan

τ-bench 1.0.1 memperbaiki penilaian banking_knowledge untuk mencegah hukuman terhadap perilaku agen yang berhati-hati

Sierra Research merilis τ-bench 1.0.1, yang memperbaiki skema penilaian tugas `banking_knowledge` untuk menghentikan hukuman terhadap agen karena verifikasi bacaan yang bijaksana dan memperbaiki beberapa inkonsistensi data. Pembaruan ini memastikan bahwa penilai ulang lintasan papan peringkat hanya meningkatkan skor, tanpa simulasi yang sebelumnya lulus menjadi gagal.

media Latent Space · 29 hari lalu · 3 tayangan

Moonshot AI meluncurkan Kimi K3, model frontier terbuka dengan 2,8T parameter

Moonshot AI telah memperkenalkan Kimi K3, model open-weights kelas frontier baru yang memiliki total 2,8 triliun parameter dan kemampuan input multimodal asli. Secara resmi diposisikan sebagai "Open Frontier Intelligence", model ini mendukung jendela konteks 1 juta token dan memanfaatkan komponen arsitektur inovatif seperti Kimi Delta Attention (KDA) dan Attention Residuals untuk meningkatkan efisiensi.

arxiv arXiv cs.AI · 2 hari lalu HealthBench · 51.9% · 4 tayangan

RAG klinis VITA menyamai atau mengungguli LLM terdepan pada HealthBench

Sebuah sistem retrieval-augmented generation yang dirancang khusus bernama VITA, yang ditujukan untuk negara berpenghasilan rendah dan menengah, dievaluasi terhadap model bahasa besar umum pada benchmark HealthBench. Studi ini menunjukkan bahwa desain yang spesifik terhadap korpus dapat mempertahankan kinerja kompetitif meskipun model terdepan baru terus dirilis.