Tim Qwen telah merilis model Qwen3.8 27B, yang mengungguli Opus 5 Medium pada Indeks Agentic Artificial Analysis.
- Qwen3.8 27B mencapai skor lebih tinggi daripada Opus 5 Medium pada benchmark Indeks Agentic Artificial Analysis.
Tim Qwen telah merilis model Qwen3.8 27B, yang mengungguli Opus 5 Medium pada Indeks Agentic Artificial Analysis.
Claude Opus 5.5 telah dirilis, memimpin SimpleBench dengan skor 88,4% dan menarik perhatian signifikan dari komunitas karena kemampuannya menghasilkan video penjelasan berkualitas tinggi.
Para peneliti memperkenalkan SkillGym, sebuah kerangka kerja yang mengubah keterampilan agen yang ditulis oleh manusia menjadi lingkungan pelatihan yang dapat dieksekusi dan diverifikasi untuk agen model bahasa besar. Sistem ini memanfaatkan pipeline skill-to-task untuk menginisialisasi tugas konkret dan memverifikasi hasil dengan checker berbasis kode.
Pengembang TrueForge, sebuah kerangka kerja agen netral-model sumber terbuka, melakukan benchmarking terhadapnya dibandingkan dengan Claude Managed Agents menggunakan DevRev Enterprise-Bench. Perbandingan tersebut mengungkapkan bahwa TrueForge dapat menyamai tingkat penyelesaian platform terkelola sambil secara signifikan mengurangi konsumsi sumber daya.
Anthropic telah merilis Claude Fable 5.1 dan Claude Mythos 5.1 sebagai model andalan barunya untuk pemrograman dan pekerjaan berbasis pengetahuan, memposisikannya sebagai model paling canggih di dunia untuk tugas otonom multi-langkah.
Ouroboros adalah wadah agen yang berkembang sendiri di mana alat, prompt, dan implementasi inti meningkat melalui commit yang ditinjau yang menjadi runtime untuk pekerjaan berikutnya. Ia beroperasi melalui evolusi bebas rekursif atau evolusi inti yang didorong oleh pengalaman, yang dipicu oleh bug dan ketidakefisienan yang ditemukan selama penggunaan.
Kami menggunakan cookie untuk mengukur lalu lintas dan meningkatkan situs. Anda dapat menerima atau menolak cookie analitik. Kebijakan privasi