Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Большую модель удалось оставить неизменной, поручив обучение компактной модели, которая выбирает стратегию следующего шага. Хотя препринт не прошёл рецензирование и числа получили сами авторы, в прямом сравнении такой подход потребовал на 58% меньше вычислительных затрат при сопоставимом результате. Для систем поиска решений это меняет архитектуру: обучать можно короткие указания, а не генератор полного кода.
Почему стратегию отделили от исполнения
Системы вроде TTT-Discover дообучают модель прямо во время решения задачи. Модель генерирует программу, проверяемый алгоритм или другую законченную конструкцию, получает оценку от автоматического проверяющего модуля и меняет свои параметры, чтобы следующие варианты стали лучше.
Такой цикл дорого запускать на большой LLM. Во время обучения приходится хранить градиенты, состояние оптимизатора и служебные данные для длинных структурированных ответов. Если надёжный код генерирует только крупная модель, она же становится самым дорогим компонентом для адаптации.
Вторая проблема связана с тем, как система распределяет награду. Проверяющий модуль оценивает готовое решение одним итоговым баллом, хотя результат зависит сразу от двух вещей: удачно ли выбрана идея и правильно ли она реализована. Полезная стратегия может получить нулевую награду из-за ошибки компиляции или неверно применённого изменения.
Guidance-TTT разделяет эти роли. Компактная модель стратегии предлагает короткое изменение высокого уровня, а замороженная GLM-5.2 применяет его к точному тексту ранее найденного решения и создаёт новый исполняемый вариант. Дообучается только первая модель.
Как обратная связь меняет следующие шаги
Система хранит архив решений вместе с их оценками и краткими описаниями. Правило PUCT выбирает из архива исходный вариант: оно учитывает как качество уже найденных потомков, так и то, насколько мало исследована соответствующая ветвь.
Для выбранного решения модель стратегии предлагает несколько изменений. Исполнитель независимо реализует каждое из них, после чего проверяющий модуль запускает получившиеся программы. Guidance-TTT сравнивает варианты, созданные из общего исходника, и повышает вероятность тех стратегий, которые привели к лучшему результату.
Обучение поэтому работает с короткими решениями вроде смены схемы планирования или способа разбиения вычислений, а не с полным кодом. Большая модель сохраняет способность реализовывать изменения, но системе не нужно обновлять её параметры после каждой проверки.
Проверка охватывает Polyomino Packing, AHC058, Lasso и оптимизацию GPU-ядра TriMul. В основном режиме стратегию генерировала Qwen3-8B, на части задач — Qwen3-14B, а исполнителем оставалась GLM-5.2. Поиск шёл без доступа к интернету и без заимствования готового кода: начальные решения создавал одиночный вызов исполнителя.
Когда подход стоит учитывать в архитектуре
На Polyomino Packing система получила 91,89 балла против 89,40 у CORAL с четырьмя агентами и доступом к интернету. Решение для Lasso работало примерно в 1,40 раза быстрее SimpleTES при той же допустимой погрешности. В TriMul задержка составила 1129 мкс против 1128 мкс у первого подходящего результата публичной таблицы; на AHC058 система также немного опередила сравниваемые методы.
Работа поддерживает разделение стратегии и исполнения, если продукт уже строит поиск вокруг исполняемого проверяющего модуля. Это относится к оптимизации алгоритмов, генерации кода и конфигураций, где итог можно автоматически запустить, проверить и свести к численной оценке.
Практический шаблон состоит из трёх независимых частей: небольшой обучаемой модели стратегии, большой замороженной модели-исполнителя и архива проверенных решений. Такое разделение позволяет менять размер и поставщика исполнителя, не перенося в него весь контур обучения.
Измеренную экономию нельзя считать универсальной оценкой инфраструктуры: прямое сравнение затрат провели на Polyomino с GPT-OSS-120B в роли альтернативного обучаемого генератора. Для сравнения размеров направляющей модели выполнено по одной поисковой траектории, а все основные результаты относятся к четырём задачам с формальным проверяющим модулем.
Остаётся и архитектурный риск. Если исполнитель неверно реализует хорошее указание, модель стратегии учится на ошибочном сигнале; если архив рано сосредоточится на одной успешной ветви, поиск продолжит улучшать знакомую конструкцию вместо проверки других подходов. Поэтому Guidance-TTT сокращает стоимость адаптации, но не заменяет контроль качества исполнителя и разнообразия поиска.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



