Журнал · Rit.work

Как превратить провалы LLM-агента в данные для дообучения

AED связывает ошибки LLM-агентов с диагнозами, исправлениями и результатами повторного запуска, чтобы обучать поиск сбоев и восстановление действий.

Rit.work
Студия разработки
1 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Неудачные запуски LLM-агента можно превращать в примеры для поиска ошибок и обучения исправленным действиям. В нерецензированном препринте Apodex, где все числа рассчитали сами авторы, исправленные действия прошли проверку в 51,1% случаев против 18,4% у повторов исходного действия. Для продуктовой команды это меняет требования к журналам агента: итоговой награды недостаточно, нужно сохранять ход выполнения и уметь воспроизводить состояние перед ошибкой.

Как провал превращается в обучающий пример

Авторы собрали Agent Error Dataset, или AED: 50 228 пар «ошибка — диагноз» из текстовых агентных систем. Коллекция охватывает 33 среды, 19 семейств исполнительных оболочек и 23 модели, которые выбирали действия.

Исходной точкой служит естественный провал: среда завершила задачу с неуспешным результатом. Сам по себе такой итог ещё не доказывает ошибку агента. Для обучающего примера нужен конкретный предотвратимый шаг, который противоречит доступным наблюдениям или уводит выполнение от цели.

Конвейер сначала сохраняет действия, наблюдения и ответы среды, а известные сбои инфраструктуры и проверяющей системы отсеивает. Затем диагностическая модель указывает ошибочный шаг и ответственный компонент, приводит подтверждение из трассы и предлагает другое действие. Структурные и смысловые проверки отбрасывают диагнозы, которые ссылаются на отсутствующие сведения или не соответствуют истории выполнения.

Если среда поддерживает повторный запуск, предложенное исправление выполняют из сохранённой контрольной точки. Одновременно из того же состояния повторяют исходное действие при одинаковых настройках модели, оболочки, бюджета и проверяющей системы. Такой контроль отделяет пользу исправления от случайного успеха при повторе.

Из одной записи строят разные наборы для дообучения. Диагностическая модель получает завершённую трассу и учится находить проблемный шаг, объяснять его и предлагать замену. Действующая модель видит историю до ошибки и учится выдавать исправленное действие, которое привело к успешному продолжению. Для обучения предпочтениям подходят только случаи, где обе альтернативы выполнили из общего состояния и получили разные результаты.

В коллекцию входят задачи из бенчмарков, синтетические сценарии и упрощённые версии сред. Не каждая запись содержит подтверждённое исправление и подходит для обучения действующей модели: часть сред нельзя надёжно восстановить, а диагноз можно строить и без повторного запуска.

Что подтвердили повторные запуски и дообучение

При проверке исправлений использовали первое предложение диагностической модели, а не лучший вариант из нескольких попыток. Контрольным примером служил свежий повтор исходного действия из той же точки. Поэтому разница показывает пользу конкретной замены в заданных условиях, но не доказывает, что агент самостоятельно найдёт момент вмешательства во время обычной работы.

Отдельно Qwen3-8B дообучили на полных диагнозах. Совпадение найденного шага с внутренними метками учителя выросло с 47,2% до 63,6%. Эта метрика показывает, насколько точно модель воспроизводит разметку AED, включая её правила и возможные дефекты, а не универсальное качество диагностики на любых агентных задачах.

Для действующей модели сравнили обучение на успешных траекториях с обучением на исправленных действиях. В WebShop-lite вариант только с исправлениями превзошёл обучение только на успехах на 6,67 процентного пункта. Это результат одного запуска, а в других проверенных средах эффект зависел от задачи, поэтому работа не обосновывает единую схему дообучения для всех агентов.

Эксперименты с диагнозами, повторным выполнением исправлений и обучением действий проводили на разных выборках. Их нельзя складывать в одну сквозную оценку: высокий процент успешных исправлений не означает, что дообученный агент так же часто сам обнаружит ошибку и восстановит выполнение.

Как работа меняет планы агентной команды

AED не даёт основания менять базовую модель только ради нового способа обучения. Работа меняет архитектуру сбора данных вокруг агента. Если система хранит лишь запрос, финальный ответ и награду, восстановить ошибочный шаг и построить проверяемую замену уже нельзя.

Практический минимум следует из устройства конвейера: сохранять последовательность действий и наблюдений, версии модели и исполнительной оболочки, параметры бюджета и результат проверяющей системы. Состояние перед действием должно либо воспроизводиться, либо сохраняться как контрольная точка. Иначе успешное исправление нельзя честно сравнить с повтором исходного поведения.

Диагностику и обучение действий стоит вести как разные контуры. Для первой достаточно качественной трассы и подтверждённой ссылки на ошибочный шаг. Для второго нужен выполненный успешный вариант из того же состояния. Смешивание этих записей создаст примеры, где правдоподобное объяснение ошибочно принимают за доказанное исправление.

Командам с воспроизводимыми средами — браузерными задачами, программными песочницами и внутренними инструментами с формальной проверкой результата — подход позволяет использовать накопленные провалы повторно. Но внедрять его разумнее как конвейер данных и проверки, а не как готовый рецепт дообучения: наиболее убедительный результат работы относится к замене действия в заранее указанной точке сбоя.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу