Журнал · Rit.work

Поиску эвристик нужен контекст для обучения LLM

Эксперименты с CALM показали, почему при онлайн-дообучении генератора эвристик нельзя опираться только на работоспособность и итоговый балл программы.

Rit.work
Студия разработки
1 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Успех отдельной программы не показывает, как лучше дообучать LLM, которая ищет эвристики: сигнал зависит от запроса и уже накопленного состояния поиска. Yilun Yuan, Tianyu Zhou и Zhenzhou Tang сравнили несколько способов назначать награду, хотя работа не рецензирована и все числа получили сами авторы. После сброса поискового состояния схема, которая усиливала лучшие варианты в группе, повысила долю работоспособных программ на 18,6 процентного пункта относительно исходной замороженной модели, но ни одна схема не победила во всех проверках.

Автоматический дизайн эвристик строит программы для задач оптимизации, запускает их и использует результат следующей попытки. Одна и та же проверенная программа здесь влияет сразу на два процесса: попадает в поисковую память и служит сигналом для обновления модели. Авторы зафиксировали поиск, группировку ответов и процедуру обновления, а меняли только способ превратить работоспособность, качество и контекст программы в награду.

Это различие важно из-за GRPO — метода, который сравнивает ответы, полученные по одному запросу, и стандартизирует их награды внутри группы. Простое прибавление одинакового бонуса после такой обработки исчезает, а порядок кандидатов, отсечение отдельных классов и нелинейные разрывы между оценками меняют обновление модели. Поэтому высокий балл программы сам по себе не говорит, полезно ли закреплять породивший её ответ: он мог лишь повторить известное решение или стать лучшим внутри слабой группы.

При одинаковой длине поиска все обучаемые варианты CALM обошли версию без обновления модели. Однако при бюджете, который позволял замороженной модели сделать больше попыток, базовая и разделяющая работоспособность с качеством схемы выиграли по конечному результату лишь в одном из трёх запусков каждая. Онлайн-обучение стабильно давало больше исполняемых предложений, но не гарантировало лучшую найденную эвристику.

Проверки механизма охватили несколько задач и две семьи моделей с 7B параметров, а основной повторяемый эксперимент провели на TSP с Qwen2.5-7B-Instruct. Остальные сочетания задач и моделей запускали однократно, поэтому результат описывает устройство CALM, а не универсально лучший способ обучения. Для подобных систем стоит хранить состояние поиска до генерации, проверять награды после нормализации и отдельно сравнивать дообучение с дополнительным поиском.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу