Журнал · Rit.work

SAGE переносит опыт тонкой настройки между задачами

SAGE сохраняет результаты поиска схем тонкой настройки и применяет их к новым задачам вместо повторного старта с нуля.

Rit.work
Студия разработки
22 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Автоматический подбор схем тонкой настройки научили сохранять удачные решения и применять их к следующим задачам. Работа Fudan University, Ant Group и Shanghai Jiaotong University не прошла рецензирование, а приведённые числа получили сами авторы: накопленный опыт поднял средний относительный выигрыш над исходной моделью на 12,4 процентного пункта. Для собственной системы автоматической настройки это меняет архитектуру: историю экспериментов стоит хранить как рабочий актив, а не как одноразовый журнал.

Систему SAGE разделили на два этапа. Сначала несколько агентов ищут схему обучения по дереву методом Монте-Карло: планируют эксперимент, запускают полноценное обучение, проверяют корректность сравнения и разбирают ошибки. Отдельный агент сохраняет конкретные сочетания метода, данных, формата и гиперпараметров, а затем выводит общие правила с условиями применимости и оценкой доверия.

На новой задаче SAGE подбирает записи из той же категории, проверяет, подходят ли их условия, и сразу составляет план обучения. На IFBench система с накопленным опытом проверила обучающие примеры программно и собрала награду из библиотеки проверки ограничений самого бенчмарка. Первый запуск дал 0,290 против 0,147 без опыта; после дальнейшего уточнения разрыв составил 0,420 против 0,240.

Опыт собирали на задачах рассуждения, усвоения знаний и следования инструкциям, а проверяли на девяти новых задачах с Qwen2.5. Сравнением служил тот же многоагентный конвейер, но без доступа к накопленным записям. Каждый узел первоначального поиска требует полноценного обучения длительностью в несколько часов, поэтому SAGE не устраняет стоимость подготовки базы опыта; работа показывает рост качества переноса, но не сравнивает итоговую стоимость или календарное время двух подходов.

Источники

Иллюстрация: рисунок из статьи «Strategy Accumulation and Guided Execution for Automated LLM Fine-Tuning», Haoran Zhao, Wei Du, Dingwen Yang и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу