AI agents
media MarkTechPost · 14 jam lalu Berkeley Function-Calling Leaderboard · 70.94% · 3 tayangan

Pokee AI merilis Pokee-Isaac 28B, model konteks 10M-token untuk deployment dalam batas yang ditentukan

Pokee AI telah merilis Pokee-Isaac 28B, model dasar hanya teks dengan 28B parameter yang memiliki jendela konteks 10M-token dan dirancang untuk beroperasi sepenuhnya di dalam batas yang dikontrol oleh pelanggan. Model ini tersedia melalui API yang kompatibel dengan OpenAI dan dilisensikan untuk deployment di VPC, lingkungan on-premises, atau perangkat keras on-device, bukan sebagai open-weight.

lab Claude Code Releases · 1 hari lalu · 8 tayangan

Claude Code v2.1.225 menambahkan peringatan batas pengeluaran gateway dan prompt kepercayaan ruang kerja

Anthropic merilis Claude Code versi 2.1.225, memperkenalkan peringatan penggunaan baru untuk batas pengeluaran gateway dan prompt kepercayaan ruang kerja untuk direktori yang tidak dipercaya. Pembaruan ini juga mengatasi beberapa masalah autentikasi, termasuk kesalahan 401 sementara pada sesi tanpa kepala dan kegagalan intermiten saat membaca kunci macOS.

media MarkTechPost · 1 hari lalu

NVIDIA merilis NOOA, kerangka kerja Python berorientasi objek untuk membangun agen AI

NVIDIA Labs telah membuka sumber NOOA (NVIDIA Object-Oriented Agents), sebuah kerangka kerja Python yang agnostik terhadap model dan mengonsolidasikan pengembangan agen ke dalam satu kelas Python. Pendekatan ini menggantikan alur kerja terfragmentasi yang melibatkan templat prompt dan grafik alur kerja dengan memetakan metode ke tindakan, bidang ke keadaan, docstring ke prompt, dan anotasi tipe ke kontrak yang ditegakkan.

lab Hugging Face Blog · 2 hari lalu · 3 tayangan

TutorMoments mengevaluasi apakah tutor AI tahu kapan harus membantu atau menahan diri

Para peneliti memperkenalkan TutorMoments, sebuah kerangka kerja yang dirancang untuk mengukur apakah model bahasa besar dapat menyeimbangkan trade-off pedagogis antara memberikan dukungan dan mendorong penalaran mandiri. Dibangun dari transkrip bimbingan matematika satu-satu yang nyata, sistem ini memutar ulang titik-titik keputusan untuk mengevaluasi perilaku model terhadap ground truth yang dianotasi oleh manusia.

lab OpenAI News · 2 hari lalu · 4 tayangan

Anthropic menghentikan pengembangan Astra setelah evaluasi internal menunjukkan kemampuan siber kritis

Anthropic telah menghentikan aktivitas internal yang melibatkan model terbarunya, Astra, karena evaluasi terbaru menunjukkan bahwa model tersebut mungkin memiliki kemampuan keamanan siber kritis di bawah Kerangka Kerja Kesiapan perusahaan. Perusahaan tidak dapat menyingkirkan kemungkinan bahwa model tersebut dapat mengidentifikasi dan mengembangkan eksploit nol-hari fungsional dalam sistem dunia nyata yang diperkuat tanpa intervensi manusia.

media TLDR AI · 3 hari lalu · 2 tayangan

Meta merilis agen terminal Muse Code; pergantian kepemimpinan Google DeepMind

Meta telah merilis Muse Code, agen pengkodean terminal yang didukung oleh Muse Spark 1.2 yang dirancang untuk menangani tugas rekayasa tingkat repositori yang kompleks. Secara bersamaan, Google DeepMind mengumumkan perubahan kepemimpinan yang signifikan, dengan Demis Hassabis pindah menjadi ketua Google DeepMind dan ilmuwan utama Alphabet, sementara Jeff Dean pergi setelah 27 tahun.

media MarkTechPost · 3 hari lalu · 14 tayangan

Prime Intellect merilis Prime Agent, kerangka kerja RLM sumber terbuka dengan kernel IPython persisten

Prime Intellect telah membuka sumber kode Prime Agent, sebuah kerangka kerja pemrograman yang meningkatkan diri sendiri dan mengganti skema alat tetap serta kompresi konteks dengan REPL Python persisten dan "Continual Harness" yang dapat ditulis ulang. Sistem ini memperlakukan delegasi sub-agen sebagai panggilan fungsi dalam lingkungan ini, memungkinkan model mengelola prompt, keterampilan, dan memori mereka sendiri.

arxiv arXiv cs.AI · 3 hari lalu SWE-bench Pro · 78.0%

Argus: Runtime Agentic Serbaguna untuk Penalaran Jangka Panjang

Para peneliti menyajikan Argus, sebuah runtime agentic yang persisten dan berevolusi secara mandiri, dirancang untuk penalaran jangka panjang yang memisahkan niat pengguna yang stabil dari tujuan operasional. Sistem ini memanfaatkan peran Manajer, Perencana, Insinyur, dan Peninjau untuk menjalankan misi terbatas di atas keadaan proyek yang tahan lama, memungkinkan eksekusi otonom antara titik eskalasi yang dimiliki operator.

media MarkTechPost · 3 hari lalu

SkillOpt dari Microsoft memungkinkan transfer keterampilan agen antara Codex dan Claude Code

Peneliti dari Microsoft, Universitas Shanghai Jiao Tong, Universitas Tongji, dan Universitas Fudan mengembangkan SkillOpt, sebuah pengoptimal ruang teks yang melatih dokumen keterampilan berbasis bahasa alami sambil menjaga model target tetap beku. Sistem ini menggunakan model pengoptimal untuk mengusulkan suntingan terbatas berdasarkan rollout yang dinilai, mengekspor hasilnya sebagai satu file `best_skill.md`.