Pesquisadores apresentam o Queen, um modelo de linguagem para xadrez com 4 bilhões de parâmetros que joga no nível de um Grande Mestre típico enquanto explica suas jogadas e planos. A estrutura combina uma arquitetura de codificador-decodificador com um algoritmo de destilação iterativa para habilitar raciocínio específico do domínio.

  • Integra um codificador silencioso especializado em xadrez com um LM ajustado por instrução por meio de atenção cruzada, treinado por meio de um currículo de perguntas e respostas.
  • Usa uma analogia em linguagem natural da atualização de Bellman para analisar posições após jogadas candidatas e consolidar explicações.
  • Ganha mais de 900 pontos Elo (de 1782 para 2697) ao longo de sete iterações, superando modelos de ponta em força de jogo e precisão em quebra-cabeças.
  • As explicações são fluentes e se aproximam do GPT-5.6-Sol (alto) em coerência, apesar de ter três ordens de magnitude a menos de parâmetros.

Os autores sugerem que essa arquitetura fornece uma receita para aplicar modelos de linguagem a domínios com codificadores silenciosos especializados, como robótica e uso de computador.