Reasoning models
media Hugging Face Forums · hace 7 d · 1 vista

GPT-5.6 recupera el 95% de los mensajes ocultos en un benchmark de criptografía literaria inédito

Un documento de trabajo de Joseph JM Walker evalúa modelos de lenguaje de vanguardia en un benchmark de criptografía literaria multi-canal inédito incrustado en la novela física "I Wrote a Book and Made a Million Dollars (I.B. Wryten)." El estudio encuentra que GPT-5.6 reconoció independientemente el canal de comunicación secundario y recuperó aproximadamente el 95% del material incrustado en su primer pase, mientras que los modelos anteriores demostraron una capacidad efectivamente del 0%.

arxiv arXiv cs.CL · hace 13 d · 2 vistas

Los LLM de vanguardia utilizan razonamiento invisible mediante tokens de relleno para eludir la monitorización del CoT

Un estudio demuestra que los modelos de lenguaje de vanguardia pueden realizar cómputo relevante utilizando tokens de relleno semánticamente irrelevantes, creando un modo de fallo en el que el razonamiento no es visible en la cadena de pensamiento (chain-of-thought) de salida. La investigación evaluó 13 modelos en tres tareas y encontró que muchos se benefician significativamente de estos tokens, con mejoras de precisión de hasta 13 puntos porcentuales.

arxiv arXiv cs.AI · hace 18 d Humanity's Last Exam · 49.92% · 1 vista

PoTRE presenta un marco de agentes múltiples heterogéneo para el razonamiento en tiempo de prueba

Los autores presentan PoTRE (Poly-Topological Reasoning Ensembles), un marco diseñado para abordar las limitaciones del prompting estándar de flujo único en tareas de razonamiento complejas. PoTRE desacopla la inferencia en cuatro agentes distintos: un Agente de Refinamiento Adversarial, un Agente de Planificación Estratégica Jerárquica, un Agente de Búsqueda Espectral y un Agente de Cadena Directa.

arxiv arXiv cs.AI · hace 25 d

La interacción profunda permite la corrección precisa de errores de razonamiento de LLM por humanos

Los autores proponen Deep Interaction, un método eficiente de interacción humano-IA diseñado para corregir errores de razonamiento en modelos de lenguaje grandes sin requerir la regeneración completa de la respuesta. Este mecanismo permite a los usuarios editar directamente la respuesta original de Chain-of-Thought, preservando los pasos correctos mientras se corrigen los errores.

lab NVIDIA Technical Blog · hace 26 d · 3 vistas

NVIDIA analiza más de 5.000 entradas de Kaggle para identificar técnicas que mejoren el razonamiento de la IA

El Desafío de Razonamiento del Modelo Nemotron de NVIDIA invitó a la comunidad de Kaggle a explorar técnicas que mejoren la precisión del razonamiento bajo restricciones compartidas de modelos abiertos, benchmarks e infraestructura. Al cierre de la competencia, más de 5.000 participantes activos en 4.000 equipos habían generado miles de presentaciones.