Los investigadores presentan Queen, un modelo de lenguaje para ajedrez de 4 mil millones de parámetros que juega al nivel de un Gran Maestro típico mientras explica sus jugadas y planes. El marco combina una arquitectura de codificador-decodificador con un algoritmo de destilación iterativa para habilitar el razonamiento específico del dominio.

  • Integra un codificador de ajedrez experto silencioso con un LM ajustado mediante instrucciones a través de atención cruzada, entrenado mediante un currículo de preguntas y respuestas.
  • Utiliza un análogo en lenguaje natural de la actualización de Bellman para analizar posiciones después de jugadas candidatas y consolidar explicaciones.
  • Gana más de 900 puntos Elo (de 1782 a 2697) en siete iteraciones, superando a los modelos de vanguardia en fuerza de juego y precisión de rompecabezas.
  • Las explicaciones son fluidas y se acercan a GPT-5.6-Sol (alto) en coherencia a pesar de tener tres órdenes de magnitud menos de parámetros.

Los autores sugieren que esta arquitectura proporciona una receta para aplicar modelos de lenguaje a dominios con codificadores expertos silenciosos, como la robótica y el uso de computadoras.