OpenAI memperkenalkan GPT-6 Sol dan Luna sebagai alternatif yang lebih cepat dan terjangkau untuk GPT-6 Astra, membawa kemajuan dalam pemrograman, faktualitas, penggunaan komputer, dan tugas profesional ke model dengan biaya lebih rendah.
- Anthropic merilis Claude Opus 5.5, yang setara dengan Claude Fable 5.1 pada sebagian besar pekerjaan sambil mengurangi biaya operasional sebesar 40% dibandingkan Opus 5.
- SWE-Bench Pro V2 dirilis dengan 642 tugas dari 11 repositori, memperbaiki kesalahan tugas sebelumnya dan mengoptimalkan proses evaluasi.
- Google memperkenalkan RRSI, sebuah metode yang menormalisasi bagaimana agen AI secara rekursif meningkatkan diri mereka sendiri untuk mengurangi overfitting pada benchmark.
Pembaruan ini memberikan pengguna opsi model yang lebih hemat biaya serta benchmark baru yang ketat untuk mengevaluasi kinerja AI.