Журнал · Rit.work

Генератор сложных задач научили улучшать собственный процесс

Контур синтеза меняет навыки, подсказки и порядок действий по мере генерации, создавая более трудные задачи и полезные данные для дообучения моделей.

Rit.work
Студия разработки
5 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Генератор задач научили менять собственный процесс работы, когда прежние приёмы перестают затруднять решение. В препринте, который не прошёл рецензирование и приводит замеры самих авторов, точность фиксированного решателя за 14 раундов упала со 100% до 54,8%: новые задачи стали для него труднее. Такой подход позволяет наращивать сложность синтетических данных без изменения весов модели.

Контур синтеза учится на неудачных решениях

Обычная рекурсивная генерация берёт готовую задачу и использует её как основу для следующей. При этом сам контур синтеза (harness) остаётся прежним: те же подсказки, набор приёмов, роли агентов и порядок проверки.

В новой схеме меняются и задачи, и процесс их создания. Веса генератора, решателя и правила итоговой проверки остаются фиксированными, поэтому рост сложности нельзя объяснить дополнительным обучением модели или ослаблением требований к корректности.

Контур обновляется двумя способами. Во время генерации он разбирает неудачную попытку решателя и превращает обнаруженную слабость в повторно используемый приём. Например, вместо сохранения ответа на конкретную задачу система формулирует общий способ построить задачи, где требуется похожее рассуждение.

После завершения пакета задач отдельный агент пересматривает библиотеку приёмов, подсказки и порядок действий. Изменённый вариант запускают на тех же исходных задачах, что и текущую версию. Его принимают, только если он сохраняет долю корректных результатов, снижает точность решателя и укладывается в допустимый рост затрат — не более 50% относительно базового варианта. Неудачные изменения откатываются.

Совместное обновление дало самые трудные задачи

Систему проверяли на математике, программировании и естественных науках. Сложность измеряли через DeepSeek-V4-Pro: чем реже фиксированный решатель давал правильный ответ, тем труднее считалась задача. Если генерация завершалась неудачно, цепочка сохраняла последнюю корректную задачу, а не подменяла её более удобным результатом.

Совместное обновление во время и после генерации снизило точность решателя на 23,5 процентного пункта сильнее, чем рекурсия с неизменным контуром. Обновление только во время работы сначала помогало, но ближе к концу часть выигрыша исчезла. Пересмотр всего процесса после пакета задач продолжал повышать сложность.

Эффект сохранился на отложенных математических исходниках, которые не участвовали в изменении контура. Обе версии запускали с одинаковой начальной точки и запрещали им дальше обновляться. Значит, преимущество связано не только с накопленными цепочками задач: изменённый процесс можно повторно применять к новым исходникам в пределах проверенного домена.

Синтетические данные также использовали для обучения с учителем и для обучения с подкреплением по проверяемой награде. Модель размером 27B после дообучения на 10K математических примеров достигла 62,5% на APEX при усреднении по 16 попыткам. Улучшения получили и на тестах по программированию и естественным наукам, поэтому результат не сводится к тому, что генератор научился затруднять работу одному решателю.

Командам стоит менять архитектуру генератора, но не план обучения

Работа меняет планы команд, которые уже строят фабрику синтетических задач для рассуждающих моделей. Если генератор представляет собой один длинный запрос или жёстко заданную цепочку, наращивание объёма данных не устраняет главный предел: процесс продолжает воспроизводить знакомые типы сложности.

Практический вывод — хранить навыки построения задач, роли, подсказки и порядок проверок как отдельные изменяемые компоненты. Для каждого изменения нужны общая контрольная группа, фиксированный проверяющий, учёт неудачных запусков и возможность отката. Иначе система может принять снижение качества за рост сложности или улучшить результат только за счёт дополнительных вычислений.

Пока подход разумнее рассматривать как надстройку над существующим конвейером, а не как замену данным от экспертов. Его проверяли на задачах с формализуемыми ответами, одном фиксированном решателе и моделях семейства Qwen для последующего обучения. Перенос изменённого контура показан на новых математических исходниках, но с тем же решателем.

В тексте работы не приведено прямое сравнение обучения на данных от фиксированного и изменяемого контуров при одинаковом числе токенов. Поэтому эксперимент показывает, что полученные данные полезны, но пока не отделяет вклад самого механизма эволюции от остальных различий в наборах.

Источники

Иллюстрация: рисунок из статьи «Recursive Harness Self-Improvement for Frontier Reasoning Data Synthesis», Wenlong Zhang, Zhengbo Jiao, Chenxu Zhang и др., CC BY-SA 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу