Topik · Reasoning models
media Latent Space · 3 hari lalu · 11 tayangan

Peneliti menguraikan jejak penalaran terenkripsi dari API Claude, GPT, dan Gemini

Sebuah makalah baru menunjukkan bahwa blok penalaran terenkripsi dari model mutakhir seperti Claude, GPT, dan Gemini dapat diuraikan dan diputar ulang untuk mengekstrak data rantai-pemikiran yang tersembunyi. Penulis menunjukkan bagaimana blob bertanda tangan ini dapat ditransfer ke model yang lebih lemah atau sesi berbeda untuk mentranskripsikan pemikiran mendasar, secara efektif menghindari upaya pengaburan dari penyedia.

arxiv arXiv cs.LG · 4 hari lalu · 11 tayangan

Peneliti mengeksploitasi penggunaan ulang enkripsi lintas sesi untuk mencuri jejak penalaran dari API LLM

Para peneliti telah mengidentifikasi kerentanan dalam cara penyedia model bahasa besar terkemuka menangani jejak penalaran bertahap, yang dikembalikan sebagai blok terenkripsi untuk penggunaan sisi klien. Mereka menemukan bahwa blok-blok terenkripsi ini sepenuhnya kompatibel dan dapat dipertukarkan di seluruh sesi, pengguna, dan model yang berbeda dalam ekosistem penyedia yang sama.

arxiv arXiv cs.AI · 4 hari lalu · 16 tayangan

Penyerang mencuri jejak penalaran dari API LLM tertutup melalui kerentanan blok terenkripsi

Para peneliti telah mengidentifikasi kerentanan arsitektural dalam cara penyedia model bahasa besar terkemuka menangani jejak penalaran langkah demi langkah. Penyedia mengembalikan jejak ini sebagai blok terenkripsi ke klien, namun studi menemukan bahwa blok-blok tersebut sepenuhnya kompatibel dan dapat dipertukarkan antar sesi, pengguna, dan model yang berbeda dalam ekosistem penyedia.

media Hugging Face Forums · 12 hari lalu · 3 tayangan

GPT-5.6 memulihkan 95% pesan tersembunyi dalam benchmark kriptografi sastra yang belum pernah dilihat sebelumnya

Sebuah makalah kerja oleh Joseph JM Walker mengevaluasi model bahasa frontier pada benchmark kriptografi sastra multi-saluran yang belum pernah dilihat sebelumnya, yang tertanam dalam novel fisik "I Wrote a Book and Made a Million Dollars (I.B. Wryten)." Studi ini menemukan bahwa GPT-5.6 secara mandiri mengenali saluran komunikasi sekunder dan memulihkan sekitar 95% materi yang disematkan pada percobaan pertama, sedangkan model-model sebelumnya menunjukkan kemampuan efektif 0%.

arxiv arXiv cs.CL · 18 hari lalu · 2 tayangan

LLM Frontier memanfaatkan penalaran tak terlihat melalui token pengisi untuk menghindari pemantauan CoT

Sebuah studi menunjukkan bahwa model bahasa frontier dapat melakukan komputasi penting menggunakan token pengisi yang tidak relevan secara semantik, menciptakan mode kegagalan di mana penalaran tidak terlihat dalam rantai-tanggapan keluaran. Penelitian ini mengevaluasi 13 model di tiga tugas dan menemukan bahwa banyak yang mendapat manfaat signifikan dari token tersebut, dengan peningkatan akurasi hingga 13 poin persentase.

arxiv arXiv cs.AI · 23 hari lalu Humanity's Last Exam · 49.92% · 1 tayangan

PoTRE memperkenalkan kerangka kerja multi-agen heterogen untuk penalaran saat pengujian

Para penulis memperkenalkan PoTRE (Poly-Topological Reasoning Ensembles), sebuah kerangka kerja yang dirancang untuk mengatasi keterbatasan prompting aliran tunggal standar dalam tugas penalaran kompleks. PoTRE memisahkan inferensi menjadi empat agen yang berbeda: Agen Refinement Adversarial, Agen Perencanaan Strategis Hierarkis, Agen Pencarian Spektrum, dan Agen Rantai Langsung.