Dua pengaturan API menggandakan skor GPT-5.6 pada ARC-AGI-3
Mengaktifkan dua pengaturan API spesifik untuk GPT-5.6 menghasilkan tripling dari skor performanya pada benchmark ARC-AGI-3.
Mengaktifkan dua pengaturan API spesifik untuk GPT-5.6 menghasilkan tripling dari skor performanya pada benchmark ARC-AGI-3.
Z.ai mengumumkan GLM-5.3, model baru yang mencapai kinerja terdepan pada benchmark pemrograman agentic dengan memperluas pelatihan pasca dari model dasarnya GLM-5.2. Model ~750B parameter ini saat ini melampaui Kimi K3 dan menyamai atau melebihi Claude Fable 5 dan GPT-5.6-Sol pada berbagai benchmark.
Perbandingan antara DeepSeek-V4 Flash 0731 dan GPT-5.6 Luna pada benchmark DeepSWE mengungkapkan bahwa meskipun GPT-5.6 Luna adalah insinyur yang lebih kuat, strategi kaskade yang menggunakan kedua model mencapai akurasi lebih tinggi dengan biaya lebih rendah.
Alibaba telah mengumumkan Qwen3.8-Max sebagai model andalan barunya, menggambarkannya sebagai arsitektur sparse 2.4T-parameter yang berfokus pada pekerjaan agentic jangka panjang, pemrograman, dan penalaran multimodal. Perusahaan mengonfirmasi bahwa bobot terbuka untuk Qwen3.8-Max akan dirilis minggu depan bersama varian open-weight Qwen3.8-27B.
DeepSeek telah memperbarui model V4 Flash-nya, merilis versi baru pada 2026-07-31 yang menunjukkan peningkatan kinerja signifikan dibandingkan pratinjau sebelumnya. Pembaruan ini memperkenalkan hasil untuk beberapa benchmark baru sambil meningkatkan skor pada yang sudah ada.
Perbandingan antara Kimi K3 dan GPT-5.6 Sol pada benchmark DeepSWE menunjukkan bahwa meskipun GPT-5.6 Sol unggul dalam kualitas single-shot (72,7% vs 68,5%), Kimi K3 mencapai skor pass@k yang lebih tinggi untuk k > 1 dengan biaya yang jauh lebih rendah.
Anthropic telah meluncurkan model Claude Opus 5, memicu tinjauan atas kinerjanya pada metrik pemrograman dan kemampuan umum serta memperbarui perdebatan seputar evaluasi model frontier.
Anthropic telah merilis Claude Opus 5, sebuah model frontier baru yang memicu diskusi signifikan mengenai skor benchmark dan kinerja praktis. Evaluasi independen dari Epoch AI melaporkan Epoch Capabilities Index (ECI) sebesar 159 dan SWE-ECI sebesar 161 untuk model baru ini.
Kimi K3, model berbobot terbuka dari Moonshot AI, mencapai kinerja yang sebanding dengan Claude Fable 5 dari Anthropic pada benchmark DeepSWE sambil membutuhkan biaya jauh lebih sedikit per tugas. Dalam evaluasi tanggal 16 Juli 2026, Kimi K3 mencapai pass@1 sebesar 68,5% dibandingkan 69,9% untuk Fable 5, namun mengunggulinya dalam skenario multi-percobaan dan menawarkan efisiensi biaya yang lebih unggul.
Sierra Research merilis τ-bench 1.0.1, yang memperbaiki skema penilaian tugas `banking_knowledge` untuk menghentikan hukuman terhadap agen karena verifikasi bacaan yang bijaksana dan memperbaiki beberapa inkonsistensi data. Pembaruan ini memastikan bahwa penilai ulang lintasan papan peringkat hanya meningkatkan skor, tanpa simulasi yang sebelumnya lulus menjadi gagal.
Pada 16 Juli, Moonshot AI merilis model andalan terbarunya, Kimi K3, sebuah arsitektur Mixture of Experts (MoE) dengan 2,8 triliun parameter. Perusahaan telah berjanji untuk merilis bobot model pada 27 Juli.
Moonshot telah merilis Kimi K3, sebuah model bobot terbuka yang memicu peninjauan ulang mengenai seberapa dekat model-model Tiongkok dengan garis terdepan. Rilis ini ditandai dengan kinerja yang kuat dalam coding, tugas agentic, dan pekerjaan pengetahuan jangka panjang.
Moonshot AI telah memperkenalkan Kimi K3, model open-weights kelas frontier baru yang memiliki total 2,8 triliun parameter dan kemampuan input multimodal asli. Secara resmi diposisikan sebagai "Open Frontier Intelligence", model ini mendukung jendela konteks 1 juta token dan memanfaatkan komponen arsitektur inovatif seperti Kimi Delta Attention (KDA) dan Attention Residuals untuk meningkatkan efisiensi.
Moonshot AI telah meluncurkan Kimi K3, sebuah model open-weights kelas frontier dengan 2,8 triliun parameter dan input multimodal asli. Model ini dilengkapi dengan Kimi Delta Attention (KDA) untuk decoding yang lebih cepat pada konteks panjang dan diposisikan untuk alur kerja agentic coding jangka panjang.
Laboratorium AI Tiongkok Moonshot AI telah mengumumkan Kimi K3, yang digambarkan sebagai model paling mampu mereka sejauh ini dengan 2,8 triliun parameter. Model ini saat ini tersedia melalui situs web dan API, dengan rilis bobot terbuka yang dijanjikan pada 27 Juli 2026.
DharmaOCR mencapai kualitas ekstraksi dan stabilitas yang lebih tinggi daripada Mistral OCR4 dan Unlimited-OCR pada Portugis Brasil melalui pelatihan spesifik domain.
Qwen telah merilis model Qwen3.8-27B, yang tersedia untuk diunduh di ModelScope dan Hugging Face.
Artikel ini menyoroti grafik dari pembaruan Gemini 3.7 Flash yang menunjukkan bahwa versi sebelumnya, khususnya 3.5 dan 3.6 Flash, tertinggal dibandingkan model seri Claude 4.8+ dan GPT 5.5+ yang lebih baru.
Seorang pengguna Reddit menyoroti model DeepSeek DSv4 Flash 0731, mencatat kemampuan kinerjanya yang kuat relatif terhadap biayanya. Postingan tersebut merujuk ke Artificial Analysis Intelligence Index v4.1.1 untuk mendukung klaim bahwa model tersebut berkinerja sangat baik.
Sebuah sistem retrieval-augmented generation yang dirancang khusus bernama VITA, yang ditujukan untuk negara berpenghasilan rendah dan menengah, dievaluasi terhadap model bahasa besar umum pada benchmark HealthBench. Studi ini menunjukkan bahwa desain yang spesifik terhadap korpus dapat mempertahankan kinerja kompetitif meskipun model terdepan baru terus dirilis.