Model DeepSeek V4-Flash baru telah meraih skor 50 pada Indeks ArtificialAnalysis. Hasil ini menempatkannya hanya satu poin di bawah GLM-5.2 dan GPT-5.6 Luna.
DeepSeek V4-Flash mencapai 50 pada Indeks ArtificialAnalysis
Benchmark
| Benchmark | Model | Skor |
|---|---|---|
| Artificial Analysis Intelligence Index | DeepSeek V4-Flash | 50% |
Kimi K3, DeepSeek V4 Pro, dan GLM-5.2 dibandingkan pada benchmark, lisensi, dan biaya penyajian
Sebuah perbandingan tiga model Sparse Mixture-of-Experts berbobot terbuka—Kimi K3 dari Moonshot AI, DeepSeek V4 Pro, dan GLM-5.2 dari Zhipu AI—mengevaluasi kemampuan, ketentuan lisensi, dan biaya penyajian mereka untuk beban kerja pemrograman jangka panjang dan agen.
Charlie O'Neill dari Base-10 berargumen Kimi dan GLM lebih baik daripada Opus 5
Charlie O'Neill dari Base-10 membahas mengapa model Kimi dan GLM "hampir secara objektif" lebih unggul daripada Opus 5 dalam episode terbaru bersama Dwarkesh Patel.
DeepSeek V4.1 Flash Memimpin Indeks Kecerdasan Artificial Analysis v4.3
DeepSeek V4.1 Flash telah mengambil tempat pertama pada benchmark Astra baru dalam pembaruan Indeks Kecerdasan Artificial Analysis v4.3.
LiveBench menambahkan DeepSeek v4.1 Flash
Platform benchmarking LiveBench telah menambahkan model DeepSeek v4.1 Flash ke dalam suite evaluasinya.
Distilasi GLM-5.3 Flash mengorbankan konsistensi untuk pengurangan biaya 17x
Perbandingan antara GLM-5.3 dan varian distilasinya, GLM-5.3 Flash, pada benchmark DeepSWE mengungkapkan bahwa distilasi mempertahankan kemampuan coding inti sambil secara signifikan mengurangi biaya rollout. Model lengkap mencapai tingkat pass@1 sebesar 69,0% dengan biaya $3,99 per tugas, sedangkan varian Flash mencetak skor 63,4% hanya dengan biaya $0,24, yang mewakili pengurangan harga sebesar 17x.