Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Из учебных историй многошаговых ИИ-агентов научились убирать бесполезные ходы так, чтобы после дообучения агент отвечал точнее и тратил меньше токенов. В препринте ShanghaiTech University, который не прошёл рецензирование и приводит замеры самих авторов, лучший экономичный вариант сократил расход токенов почти на 48% при сопоставимой точности. Команда может чистить уже собранные траектории перед обучением, а не пытаться ограничивать рассуждения агента во время работы.
Как граф отделяет полезный ход от тупикового
Учебная траектория агента состоит из вопроса, рассуждений, вызовов инструментов, их ответов и итогового сообщения. В таких записях остаются неудачные поисковые запросы, повторные проверки и параллельные ветки, результаты которых агент не использует в ответе.
Для каждой траектории строят ориентированный ациклический граф (DAG). Его вершины соответствуют ходам, а ребро показывает, что следующий ход использует конкретный результат предыдущего: число, имя, ссылку или промежуточный вывод. Простые упоминания вроде «этот поиск не помог» зависимостью не считаются.
Связи размечает GPT-5.4, после чего преобразования выполняются по формальным правилам. Самый осторожный вариант L1 удаляет конечные ветки, которые ничего не передают дальше. Такой ход мог вызвать инструмент и получить ответ, но его результат не повлиял ни на один последующий шаг.
L2 дополнительно объединяет параллельные ходы, если у них совпадают входные зависимости и получатель результата. Более агрессивный L3 требует только общих входов и повторяет слияние, пока кандидаты не закончатся. В вариантах L2a и L3a модель переписывает объединённое рассуждение в связный текст, но сохраняет вызовы инструментов и их ответы без изменений.
Для обучения использовали 6 196 мультимодальных траекторий с инструментами. Очистка происходит до обучения: в рабочий цикл агента не нужно добавлять отдельный фильтр или ещё один вызов модели.
Осторожное удаление повышает точность, слияние снижает расход
Лучший результат по качеству дал L1: средняя точность оказалась на 1,7 процентного пункта выше, чем у обычного SFT — обучения с учителем на исходных траекториях. Это указывает, что тупиковые ходы не просто занимают место, а могут приучать модель повторять бесполезные действия.
Для экономии выгоднее оказался L2a. Он расходовал в среднем 10 977 токенов на пример вместо 20 940 у исходного SFT, то есть почти на 48% меньше. Средняя точность при этом была ниже лишь на 0,25 процентного пункта.
Прямое удаление ходов по решению модели-оценщика сработало хуже. Оно может выбросить промежуточный поиск, хотя финальный ответ всё ещё ссылается на найденный факт. Ученик тогда видит утверждение без источника и осваивает повреждённую последовательность действий.
Самое агрессивное слияние тоже нарушило поведение агента. В обучающих данных несколько вызовов инструментов оказывались внутри одного хода, тогда как при проверке агент обычно делал по одному вызову за ход. Из-за этого он чаще застревал в длинных циклах. Перефразирование уменьшило разрыв форматов, но не устранило структурную причину полностью.
Меняет ли работа планы команд с инструментальными агентами
Если команда уже собирает синтетические траектории для SFT, графовую очистку стоит проверить до расширения датасета. L1 подходит как осторожный вариант с приоритетом качества, а L2a — когда стоимость и задержка инференса важнее небольшого расхождения в точности. Оба подхода меняют данные, а не архитектуру модели, поэтому их можно сравнить на существующем обучающем конвейере.
Практическая цена метода — дополнительная разметка зависимостей. Перефразирование объединённых рассуждений требует ещё одного прохода модели, однако последующие операции над графом детерминированы: можно увидеть, какой ход удалили или с каким объединили. Это упрощает аудит по сравнению с командой «удали всё лишнее», решение которой трудно проверить.
Работу проверяли на четырёх наборах мультимодальных вопросов с поиском и другими инструментами, используя только семейство Qwen3-VL-30B-A3B-Thinking. Сравнение охватывает исходное SFT, модель без дообучения, прямое удаление ходов и несколько вариантов графовой очистки. Результат пока обосновывает эксперимент на собственных данных, но не замену конвейера для текстовых агентов, других моделей или протоколов с несколькими вызовами инструмента за ход.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



