Hasil DeepSeek V4 Flash 0731 di ARC-AGI
Artikel ini menyajikan hasil benchmark ARC-AGI untuk model DeepSeek V4 Flash 0731. Artikel ini menautkan ke halaman hasil resmi yang dihosting oleh organisasi ARC Prize.
Artikel ini menyajikan hasil benchmark ARC-AGI untuk model DeepSeek V4 Flash 0731. Artikel ini menautkan ke halaman hasil resmi yang dihosting oleh organisasi ARC Prize.
DeepSeek telah merilis DeepSeek-V4-Flash-0731, versi pembaruan dari model "Flash" berukuran lebih kecil yang mengungguli DeepSeek-V4-Pro yang lebih besar pada benchmark independen. Rilis ini memanfaatkan proses fine-tuning baru sambil mempertahankan arsitektur Mixture-of-Experts asli dengan total 284 miliar parameter.
Perbandingan antara DeepSeek-V4 Flash 0731 dan GPT-5.6 Luna pada benchmark DeepSWE mengungkapkan bahwa meskipun GPT-5.6 Luna adalah insinyur yang lebih kuat, strategi kaskade yang menggunakan kedua model mencapai akurasi lebih tinggi dengan biaya lebih rendah.
Artificial Analysis telah memperbarui indeks agentiknya untuk peringkat Qwen 3.8 Max sebagai model terbaik secara keseluruhan, menempatkannya di depan Opus 5.
Para penulis mengidentifikasi bahwa skor yang stagnan pada benchmark SciCode berasal dari cacat signifikan dalam instrumen evaluasi, bukan dari keterbatasan kemampuan model. Audit oleh pakar domain terhadap 65 soal pengujian menemukan 263 cacat, dengan 192 di antaranya menyebabkan solusi yang benar ditolak secara keliru karena masalah seperti jawaban acuan yang tidak dapat direproduksi dan toleransi yang terlalu ketat.
Alibaba telah mengumumkan Qwen3.8-Max sebagai model andalan barunya, menggambarkannya sebagai arsitektur sparse 2.4T-parameter yang berfokus pada pekerjaan agentic jangka panjang, pemrograman, dan penalaran multimodal. Perusahaan mengonfirmasi bahwa bobot terbuka untuk Qwen3.8-Max akan dirilis minggu depan bersama varian open-weight Qwen3.8-27B.
Qwen 3.8 Max mencapai skor 1588 di Debate Benchmark, meningkatkan skor 1462 dari Qwen 3.7 Max. Benchmark ini mengevaluasi seberapa baik model bahasa besar mempertahankan argumen di bawah oposisi adversarial dan multi-tur di berbagai topik.
Evaluasi internal terhadap model open-weight pada tugas agentic yang sulit menemukan DeepSeek v4 flash sebagai opsi tercepat dan termurah di antara rekan-rekannya. Pengujian melibatkan alur kerja jangka panjang di berbagai aplikasi, dinilai dengan pemeriksaan deterministik yang mensyaratkan keberhasilan penuh.
Qwen3.8-Max (2.4T) adalah model bobot terbuka baru yang performanya sangat dekat dengan Kimi K3 dan DeepSeek V4 Flash di semua kategori benchmark, sambil menunjukkan kinerja superior dalam tugas pemrograman dan perangkat lunak.
Qwen 3.8-Max telah dirilis dan saat ini menempati posisi #2 di papan peringkat Vision Arena, hanya tertinggal dari Claude Fable 5 Max.
Artikel ini mengumumkan bahwa model DeepSeek-V4-Flash-0731 telah melampaui Fable-5, Sol, dan Kimi-K3 pada sebuah benchmark catur.
Levent Bulut menerbitkan sebuah benchmark tiga studi yang mengevaluasi keandalan anotasi yang dihasilkan mesin untuk korpus naratif Turki, mengungkapkan ketidaksesuaian signifikan antara penilai otomatis dan penilaian manusia. Studi ini menguji enam fitur kerajinan biner di 120 dan 100 adegan menggunakan detektor berbasis aturan dan model termasuk Gemini 2.5 Flash, Grok, ChatGPT 5.5, dan Claude Fable 5 High.
Model DeepSeek-V4-Flash-0731 telah mencapai skor indeks kecerdasan 50, sebuah metrik yang menyamai kinerja model frontier terkemuka dari Maret 2026, yang memiliki skor 51.
Sebuah meme terjemahan yang beredar di Reddit menunjukkan bahwa pesaing harus mengurangi harganya sebesar 80% karena tekanan kompetisi dari DeepSeek v4 flash. Model bobot terbuka ini memiliki 284 miliar parameter total dengan 13 miliar parameter aktif, memberikan metrik harga-kinerja yang unggul.
DeepSeek mengklaim bahwa model umumnya yang baru tersedia, DeepSeek V4 Flash, mencapai kesetaraan kinerja dengan Anthropic's Sonnet 5 dan xAI's Grok 4.5 pada benchmark DeepSWE.
Model DeepSeek-V4-Flash-0731 sekarang secara signifikan mengungguli DeepSeek-V4-Pro-Preview di berbagai uji benchmark.
Model DeepSeek V4-Flash baru telah meraih skor 50 pada Indeks ArtificialAnalysis. Hasil ini menempatkannya hanya satu poin di bawah GLM-5.2 dan GPT-5.6 Luna.
Model DeepSeek-V4-Flash-0731 mengungguli GLM 5.2 sambil mempertahankan harga yang sama dengan pendahulunya.
DeepSeek telah memperbarui model V4 Flash-nya, merilis versi baru pada 2026-07-31 yang menunjukkan peningkatan kinerja signifikan dibandingkan pratinjau sebelumnya. Pembaruan ini memperkenalkan hasil untuk beberapa benchmark baru sambil meningkatkan skor pada yang sudah ada.
Seorang pengguna mengevaluasi Kimi K3 terhadap Claude Opus 4.8 dengan menjalankan 34 prompt satu-sentuhan dan menilai HTML, tangkapan layar, dan GIF yang dihasilkan menggunakan Sonnet 4.6. Evaluasi menyimpulkan bahwa Kimi K3 menghasilkan hasil yang lebih baik daripada Opus 4.8.