Un estudio demuestra que los modelos de lenguaje de vanguardia pueden realizar cómputo relevante utilizando tokens de relleno semánticamente irrelevantes, creando un modo de fallo en el que el razonamiento no es visible en la cadena de pensamiento (chain-of-thought) de salida. La investigación evaluó 13 modelos en tres tareas y encontró que muchos se benefician significativamente de estos tokens, con mejoras de precisión de hasta 13 puntos porcentuales.
- Los tokens de relleno permiten a Claude Opus 4.5 satisfacer restricciones ocultas de aritmética modular sin sacrificar la precisión de la tarea principal.
- El aprendizaje por refuerzo otorga a Qwen3-235B fuertes preferencias por el contenido específico de los tokens de relleno, pero ni el RL ni el ajuste fino supervisado producen beneficios que persistan en el momento de la prueba.
- El beneficio en el rendimiento depende de qué tokens se utilizan y varía entre diferentes modelos.
Estos resultados indican que los modelos de vanguardia ya realizan cómputo sin una traza interpretable en sus tokens de salida, demostrando que el razonamiento invisible puede servir a objetivos completamente invisibles para la monitorización del chain-of-thought.