Topik · Benchmark results
lab NVIDIA Research · 19 hari lalu · 21 tayangan

ReasoningBomb memicu penalaran yang secara patologis panjang pada model penalaran besar

Para peneliti telah memformalkan serangan penolakan layanan saat inferensi (PI-DoS) yang memanfaatkan biaya komputasi tinggi dari penalaran eksplisit multi-langkah dalam Model Penalaran Besar (LRM). Mereka menyajikan ReasoningBomb, sebuah kerangka kerja berbasis pembelajaran penguatan yang melatih penyerang untuk menghasilkan prompt alami singkat yang mendorong model korban ke dalam jejak penalaran yang secara patologis panjang dan sering kali tidak berakhir.

lab Hugging Face Blog · 1 hari lalu · 8 tayangan

NVIDIA merilis model dasar Kumo Tabular terbuka untuk prediksi tabel tanpa pelatihan

NVIDIA telah merilis Kumo Tabular, sebuah model dasar terbuka untuk klasifikasi dan regresi tabel yang beroperasi melalui pembelajaran dalam konteks tanpa memerlukan pelatihan atau rekayasa fitur. Dilatih secara eksklusif pada data buatan yang dihasilkan oleh Model Kausal Struktural, model ini tersedia dalam tiga ukuran dengan jumlah parameter berkisar dari 28M hingga 215M.

media The Batch · 5 hari lalu Humanity's Last Exam · 61.4% · 11 tayangan

Anthropic merilis Claude Opus 5.5; TypeSafe meluncurkan model klasifikasi Jev

Anthropic telah merilis Claude Opus 5.5, penerus berbiaya lebih rendah dari Claude Opus 5 yang memimpin Indeks Kecerdasan Artificial Analysis v4.3 dan Vals AI’s Vals Index dalam benchmark kecerdasan secara keseluruhan. Secara bersamaan, TypeSafe, yang didirikan oleh alumni OpenAI Diogo Almeida, memperkenalkan Jev, sebuah model klasifikasi umum yang dirancang untuk menganalisis teks dan mengembalikan output yang telah ditentukan sebelumnya dengan biaya lebih rendah dibandingkan model bahasa besar.

media MarkTechPost · 8 hari lalu GDPval-AA (Elo) · 1695.0Elo · 23 tayangan

SpaceXAI merilis Grok 4.7 dengan model dasar lebih besar dan peningkatan benchmark

SpaceXAI telah merilis Grok 4.7, model andalan baru untuk pemrograman, tugas agentic, dan kerja pengetahuan yang memanfaatkan model dasar lebih besar dan durasi pelatihan penguatan (reinforcement learning) lebih panjang dibandingkan Grok 4.6. Model ini mempertahankan struktur harga yang sama dengan pendahulunya sambil menawarkan kemampuan yang ditingkatkan dalam verifikasi diri, penanganan konteks panjang, dan keamanan.

media The Batch · 19 hari lalu GPQA Diamond · 96.3% · 32 tayangan

OpenAI meluncurkan GPT-6 Astra, menduduki puncak papan peringkat dengan biaya lebih rendah

OpenAI telah merilis GPT-6 Astra, model visi-bahasa andalan barunya yang mencapai peringkat teratas atau hampir teratas di berbagai papan peringkat AI utama sambil menggunakan token secara signifikan lebih sedikit dan menelan biaya lebih murah dibandingkan model pesaing. Model ini dirancang untuk memenuhi tingkat keamanan siber kritis OpenAI, dengan kemampuan siber lanjutan dibatasi hanya untuk organisasi terpilih.

media MarkTechPost · 6 jam lalu

Peneliti NVIDIA merilis Physis-Lang untuk meningkatkan penalaran fisika pada model video Cosmos 3

Peneliti dari NVIDIA, MIT, dan Universitas Oxford telah memperkenalkan Physis-Lang, sebuah kerangka kerja yang meningkatkan model dunia video dengan mengintegrasikan bahasa fisik yang berevolusi secara mandiri ke dalam caption. Pendekatan ini memperlakukan bahasa fisik sebagai representasi yang dapat dioptimalkan untuk kurasi data, pelatihan model, dan inferensi guna memperbaiki kesalahan fisika pada video yang dihasilkan.