Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Учебную смесь для LLM научили перестраиваться по мере того, как модель осваивает прежние задачи. В работе University of Southern California, The George Washington University и Georgia Institute of Technology SynCo повысил среднюю точность Qwen3-8B на 2,87 процентного пункта относительно адаптивного генератора без обучения, хотя работа не рецензирована и числа получили сами авторы. Для команд, которые дообучают собственные модели на синтетических данных, генератор задач становится частью контура обучения, а не внешним поставщиком корпуса.
Генератор получает обратную связь от решателя
Статический набор постепенно теряет ценность. Простые задачи модель уже решает без ошибок, слишком сложные стабильно проваливает, а обучение с подкреплением получает мало полезного сигнала в обоих случаях.
SynCo связывает две модели с разными параметрами. Генератор создаёт задачу, эталонное решение и описание того, какой навык она должна проверять. Модель-решатель видит только условие и делает несколько независимых попыток, поэтому эталонный ответ в её контекст не попадает.
Перед обучением система проверяет формат, полноту и непротиворечивость задачи, сверяет ответ и отсеивает повторы. Отклонённые примеры тоже сохраняются: генератор получает причины отказа и должен реже воспроизводить те же дефекты.
Принятые задачи дают разные сигналы двум участникам. Решатель получает награду за правильные ответы. Генератор оценивают по качеству задачи, надёжности эталона и обучающей ценности: выше всего ценятся случаи, где часть попыток успешна, а часть нет.
Такая смесь результатов означает, что задача находится около текущей границы возможностей модели. Если все попытки одинаковы, групповое обучение почти не может предпочесть одну траекторию другой. Поэтому заявленная генератором сложность сама по себе недостаточна: полезность определяет поведение решателя.
После обновления обеих моделей система заново собирает контекст. В него входят недавние задачи, успехи решателя, пробелы в покрытии и причины отклонений. Генератор меняет не только запрос на следующую задачу, но и собственную стратегию создания данных.
Полезные задачи оказались не самыми трудными
Метод проверили на восьми тестах по математическим рассуждениям. SynCo сравнили со статическими корпусами, отдельным обновлением данных, другими системами совместной эволюции и контрольным вариантом, где генератор видел состояние решателя, но его параметры оставались замороженными.
Главный результат объясняет не общий рост сложности, а положение задач относительно возможностей модели. У SynCo полезный для группового обучения разброс ответов возник у 22,8% задач. У трёх статических источников доля лежала между 4,1% и 10,9%: один корпус чаще давал уже освоенные примеры, другой чаще ставил задачи за пределами текущих возможностей.
Большая часть итогового преимущества пришлась на примеры, которые исходная модель не решала: 80,4% дополнительных правильных ответов относились именно к ним. То есть SynCo не просто помог сохранить прежние навыки, а сдвинул границу решаемых задач.
Границы проверки узкие: авторы обучали варианты Qwen3 двух размеров и оценивали математические задачи с ответами, которые можно автоматически сверить. Работа показывает свойства контура дообучения для рассуждений, но не проверяет открытые диалоги, работу с инструментами или бизнес-процессы, где качество нельзя свести к однозначному ответу.
Когда SynCo меняет план обучения модели
Работа меняет планы команд, которые уже собираются регулярно дообучать модель на автоматически созданных задачах. В такой архитектуре недостаточно периодически обновлять корпус или просить фиксированную LLM генерировать более сложные примеры. Нужно хранить результаты попыток, измерять полезность задачи для текущей версии решателя и обновлять политику генератора по этой обратной связи.
Дополнительные вычисления в сопоставимом эксперименте оказались небольшими: полное время шага выросло на 0,6%. Доля задач с полезным обучающим сигналом поднялась с 13,7% до 14,5%. Сравнение относится к уже работающему адаптивному контуру с тем же числом попыток решателя, поэтому оно не оценивает полную стоимость разработки проверок, памяти и генератора с нуля.
Практический барьер — автоматическая проверка результата. В математике можно нормализовать число, формулу или множество и сравнить их с эталоном. Для программирования аналогом могут служить тесты, но для переговоров, анализа документов или действий в интерфейсе потребуется отдельный проверяемый сигнал; без него генератор не узнает, чему действительно научился решатель.
Командам, которые используют готовую модель через API и не проводят собственное дообучение, SynCo не меняет архитектуру продукта. Для разработчиков базовых и специализированных моделей вывод конкретнее: синтетический корпус стоит проектировать как меняющуюся политику, а не как актив, который достаточно один раз собрать и очистить.
Источники
Иллюстрация: рисунок из статьи «SynCo: Data Synthesis Co-Training for Self-Evolving LLMs via Multi-Agent Reinforcement Learning», Wei Yang, Shawn Li, Yuehan Qin и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



