Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Шахматную языковую модель научили одновременно выбирать сильные ходы и объяснять их обычным текстом. В нерецензированном препринте Princeton University, где замеры провели сами авторы, Queen достигла рейтинга гроссмейстера и обошла универсальные модели. Работа предлагает архитектурный рецепт для продуктов, где специализированная модель уже принимает хорошие решения, но не умеет разговаривать с пользователем.
Шахматный движок передаёт знания, а языковая модель формулирует ответ
Обычный шахматный движок оценивает позиции и предлагает ходы, но не строит связное объяснение. Универсальная LLM умеет писать убедительно, однако может неверно представить доску, предложить незаконный ход или объяснить слабое решение.
Queen разделяет эти задачи. Шахматный кодировщик Leela получает позицию и преобразует её в скрытые представления: где стоят фигуры, какие ходы допустимы, какие продолжения выглядят перспективными. Декодер SmolLM3-3B использует эти представления, чтобы выпускать текст, лучший ход и ожидаемую последовательность ответов соперника. Вместе компоненты образуют модель примерно на 4 млрд параметров.
Компоненты связывает перекрёстное внимание (cross-attention). Промежуточные слои Leela передают свои состояния соответствующим слоям языковой модели, поэтому декодер получает не только итоговую оценку позиции. Он может извлекать признаки, которые движок сформировал на разных этапах обработки доски.
Одного подключения недостаточно: языковая модель ещё не знает, как читать эти признаки. Поэтому мост обучают на последовательности программно проверяемых вопросов. Сначала модель распознаёт фигуры и поля, затем перечисляет допустимые ходы и атаки, после чего восстанавливает позицию через один-восемь ходов и анализирует уже её.
На этом этапе Leela и SmolLM остаются замороженными: меняются параметры моста и представления специальных шахматных токенов. В проверках удаление кодировщика или учебной последовательности резко ухудшало игру. Значит, результат дала не просто разметка от сильной модели: декодер действительно научился использовать внутреннее представление шахматного эксперта.
Объяснение улучшается через разбор будущих позиций
После предметной адаптации модель понимает доску, но ещё не умеет выдавать ответ нужного формата. Начальную выборку составили из 15 тысяч позиций, для которых GPT-5.6-Sol подготовила лучший ход, продолжение партии, текстовое объяснение, несколько альтернатив и оценку позиции. Ответы с незаконными ходами и ошибками отфильтровали.
Дальше Queen улучшает данные для собственного обучения. Она выбирает перспективные ходы, отдельно анализирует позиции после каждого из них, а затем объединяет дочерние объяснения в один ответ для исходной позиции. Итог должен показать не только преимущество выбранного хода, но и недостатки альтернатив.
Такой цикл напоминает поиск по дереву, только вместо одной числовой оценки вверх передаётся текстовый разбор. Объединённые объяснения становятся новой учебной выборкой, модель дообучается и повторяет процесс. По сути, вычислительно дорогой поиск постепенно переносится в параметры модели.
За семь циклов рейтинг вырос с 1782 до 2697. Для сравнения, GPT-5.6-Sol получил 2071, а Gemini-3.1-Pro — 2201. Queen также чаще предлагала продолжения без шахматных ошибок, хотя в описаниях мотивов уступала универсальным моделям: итерации улучшили структуру анализа, но могли закреплять неверные названия вилок, связок и других шахматных идей.
Проверка охватывала игру, тактические задачи и обычные позиции. Качество разделили на силу рекомендуемого хода, обоснованность продолжения и связность текста; последнюю оценивала GPT-5.6-Sol, а не шахматисты. Поэтому работа убедительнее показывает рост качества решений, чем понятность объяснений для реального пользователя.
Рецепт полезен там, где эксперт уже существует
Работа не предлагает заменить специализированную систему универсальной LLM. Наоборот, она оставляет экспертную модель источником предметных признаков, а языковой модели поручает запросы, объяснения и сборку результата. Это снижает риск потерять качество решений ради удобного интерфейса.
Архитектурный план имеет смысл менять, если эксперт построен как нейросетевой кодировщик и его промежуточные состояния доступны. Понадобятся также проверяемые вопросы для адаптации моста, способ развернуть состояние после возможного действия и оценка, которая поможет сравнить ветви. В шахматах всё это дают правила, движок и поиск.
Для робототехники или управления компьютером тот же подход потребует модели состояния и надёжной проверки последствий. Если продукт располагает только закрытым API с готовым решением, связать внутренние представления через внимание не получится. Тогда от Queen остаётся лишь идея улучшать объяснения через анализ нескольких будущих состояний.
Отдельно важен эксперимент без разметки от передовой LLM: шаблонные объяснения, собранные из признаков Stockfish, дали похожее направление роста. Значит, команде не обязательно постоянно покупать ответы самой дорогой модели. Но ей всё равно нужен формальный эксперт, чьи решения можно проверить и превратить в учебные примеры.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



