Исследователи представляют Queen, шахматную языковую модель с 4 миллиардами параметров, которая играет на уровне типичного гроссмейстера, одновременно объясняя свои ходы и планы. Архитектура объединяет кодировщик-декодировщик с алгоритмом итеративной дистилляции для обеспечения специфического для домена рассуждения.
- Интегрирует молчаливый экспертный шахматный кодировщик с инструктивно настроенной языковой моделью через механизм cross-attention, обучаясь по программе вопросов и ответов.
- Использует аналог обновления Беллмана на естественном языке для анализа позиций после кандидатов на ходы и консолидации объяснений.
- Прирост более 900 очков Эло (с 1782 до 2697) за семь итераций, превосходя передовые модели по силе игры и точности решения задач.
- Объяснения беглы и приближаются к GPT-5.6-Sol (high) по связности, несмотря на наличие на три порядка меньше параметров.
Авторы предполагают, что данная архитектура предоставляет рецепт применения языковых моделей к доменам с молчаливыми экспертными кодировщиками, таким как робототехника и управление компьютером.