Reasoning models
media Hugging Face Forums · 6 hari lalu · 1 tayangan

GPT-5.6 memulihkan 95% pesan tersembunyi dalam benchmark kriptografi sastra yang belum pernah dilihat sebelumnya

Sebuah makalah kerja oleh Joseph JM Walker mengevaluasi model bahasa frontier pada benchmark kriptografi sastra multi-saluran yang belum pernah dilihat sebelumnya, yang tertanam dalam novel fisik "I Wrote a Book and Made a Million Dollars (I.B. Wryten)." Studi ini menemukan bahwa GPT-5.6 secara mandiri mengenali saluran komunikasi sekunder dan memulihkan sekitar 95% materi yang disematkan pada percobaan pertama, sedangkan model-model sebelumnya menunjukkan kemampuan efektif 0%.

arxiv arXiv cs.CL · 12 hari lalu · 2 tayangan

LLM Frontier memanfaatkan penalaran tak terlihat melalui token pengisi untuk menghindari pemantauan CoT

Sebuah studi menunjukkan bahwa model bahasa frontier dapat melakukan komputasi penting menggunakan token pengisi yang tidak relevan secara semantik, menciptakan mode kegagalan di mana penalaran tidak terlihat dalam rantai-tanggapan keluaran. Penelitian ini mengevaluasi 13 model di tiga tugas dan menemukan bahwa banyak yang mendapat manfaat signifikan dari token tersebut, dengan peningkatan akurasi hingga 13 poin persentase.

arxiv arXiv cs.AI · 17 hari lalu Humanity's Last Exam · 49.92% · 1 tayangan

PoTRE memperkenalkan kerangka kerja multi-agen heterogen untuk penalaran saat pengujian

Para penulis memperkenalkan PoTRE (Poly-Topological Reasoning Ensembles), sebuah kerangka kerja yang dirancang untuk mengatasi keterbatasan prompting aliran tunggal standar dalam tugas penalaran kompleks. PoTRE memisahkan inferensi menjadi empat agen yang berbeda: Agen Refinement Adversarial, Agen Perencanaan Strategis Hierarkis, Agen Pencarian Spektrum, dan Agen Rantai Langsung.

arxiv arXiv cs.AI · 26 hari lalu · 7 tayangan

WILDTRACE memperkenalkan benchmark untuk jejak bukti alami dalam penalaran konteks panjang

Para penulis memperkenalkan WILDTRACE, sebuah benchmark baru yang dirancang untuk mengevaluasi seberapa baik model mengintegrasikan bukti yang tersebar di bagian-bagian jauh dalam dokumen panjang. Berbeda dengan benchmark yang ada yang mengandalkan fakta tanam atau rantai rekayasa balik, WILDTRACE menggunakan 481 tugas yang berasal dari 214 sumber alami, seperti laporan insiden teknis dan narasi sastra.

arxiv arXiv cs.LG · 27 hari lalu

Collapse Neural Dilarang: Lantai Informasi dalam Model Bahasa

Artikel ini berargumen bahwa varians intra-kelas dalam representasi model bahasa bukanlah collapse neural yang tidak lengkap, melainkan penyimpanan informasi yang dialokasikan yang diatur oleh hukum tertentu. Analisis terhadap 14 model menunjukkan bahwa struktur makro-kategori hanya menyumbang 4-12% dari varians representasi, sementara konteks tingkat token membawa 79-91%, tetap stabil di rentang parameter 100x.