Les chercheurs présentent Queen, un modèle de langage aux échecs de 4 milliards de paramètres qui joue au niveau d'un grand maître typique tout en expliquant ses coups et ses plans. Le cadre combine une architecture encodeur-décodeur avec un algorithme de distillation itérative pour permettre un raisonnement spécifique au domaine.

  • Intègre un encodeur d'échecs expert silencieux avec un LM ajusté par instructions via une attention croisée, entraîné via un curriculum de questions-réponses.
  • Utilise une analogie en langage naturel de la mise à jour de Bellman pour analyser les positions après les coups candidats et consolider les explications.
  • Gagne plus de 900 points Elo (de 1782 à 2697) sur sept itérations, surpassant les modèles de pointe en force de jeu et en précision des puzzles.
  • Les explications sont fluides et approchent la cohérence de GPT-5.6-Sol (high) malgré trois ordres de grandeur moins de paramètres.

Les auteurs suggèrent que cette architecture fournit une recette pour appliquer les modèles de langage à des domaines avec des encodeurs experts silencieux, tels que la robotique et l'utilisation d'ordinateur.