Reasoning models
arxiv arXiv cs.CL · 7 jam lalu · 11 tayangan

TelecomGPT-R1: Pelatihan Pasca-Unifikasi untuk Penalaran Melintasi Tugas Telekomunikasi Heterogen

Para peneliti memperkenalkan TelecomGPT-R1, sebuah keluarga model penalaran telekomunikasi terpadu sumber terbuka yang dirancang untuk mengotomatisasi tugas teknik dengan menalar atas standar, konfigurasi, dan log. Model ini mengatasi keterbatasan LLM umum dan khusus yang ada melalui pendekatan terstruktur yang mencakup aspek protokol, pengetahuan, pemodelan, dan gangguan.

media Hugging Face Forums · 1 hari lalu · 10 tayangan

CosmicUndercurrent merilis Principia-Structurae-Realitatis untuk menguji koordinasi sistem keseluruhan LLM

CosmicUndercurrent telah membuka sumber sebuah kerangka kerja penalaran yang tidak bergantung pada model, dirancang untuk menguji apakah priming struktural dapat mengurangi inkonsistensi global dalam model bahasa besar. Proyek ini, yang dihosting, menyelidiki apakah proses dua langkah meningkatkan koordinasi sistem keseluruhan dibandingkan dengan kebenaran lokal.

lab NVIDIA Research · 12 hari lalu · 12 tayangan

ReasAlign menggunakan penalaran untuk membela agen LLM terhadap injeksi prompt

Para peneliti memperkenalkan ReasAlign, solusi tingkat model yang dirancang untuk meningkatkan keselarasan keamanan dalam Model Bahasa Besar (LLM) terhadap serangan injeksi prompt tidak langsung. Pendekatan ini mengintegrasikan langkah-langkah penalaran terstruktur untuk menganalisis kueri pengguna dan mendeteksi instruksi yang bertentangan, memastikan kesinambungan tugas yang dimaksudkan oleh pengguna.

blog Simon Willison · 21 hari lalu · 40 tayangan

Anthropic merilis Claude Fable 5.1 dengan peningkatan benchmark pemrograman dan sains

Anthropic telah merilis Claude Fable 5.1, sebuah pembaruan model yang menetapkan standar baru untuk tugas pemrograman, kerja berbasis pengetahuan, dan pemecahan masalah jangka panjang. Rilis ini menyoroti peningkatan kinerja signifikan pada benchmark Terminal-Bench-Science 0.1 yang baru, di mana Fable 5.1 mencapai skor 52,6%, dibandingkan dengan 24,7% untuk Fable 5, 29,0% untuk Opus 5, dan 22,4% untuk GPT-5.6 Sol.