Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Диагностического агента научили искать причину аномалии по данным, когда правильный ответ в реальной системе трудно или дорого подтвердить. Хотя препринт независимых исследователей Rui Sun, Zhan Shi и Bing He не прошёл рецензирование и все числа получили сами авторы, обученная модель дала 75,7% полностью верных первых ответов против 68,6% у лучшей модели, работавшей только по инструкции. Если команда умеет воспроизводить причины сбоев в симуляторе, такой симулятор может стать источником не только тестовых задач, но и награды для обучения.
Как скрытая причина становится проверяемой наградой
Обычная диагностика начинается с наблюдаемой аномалии. Агент видит падение продаж, рост стоимости клика или изменение трафика и пытается восстановить причину, которой может не быть в данных. Даже эксперт не всегда отделит её от сезонности, шума и нескольких одновременных изменений.
TRACE разворачивает процесс в обратную сторону. Система сначала выбирает одно из 12 вмешательств, например ограничение бюджета, ухудшение страницы или падение качества объявления. Затем она внедряет причину в симулятор рекламных кампаний и генерирует таблицы с показами, кликами, заказами, расходами и разрезами по сегментам.
Выбранное вмешательство остаётся скрытым от агента, но система сохраняет его как правильный ответ. Агент получает только таблицы и описание аномалии, исследует данные через Python и SQL, выдвигает гипотезы и в конце называет причину. Для локального эффекта он также должен точно указать затронутый сегмент, иногда заданный пересечением нескольких признаков.
Отдельный проверяющий модуль отсеивает задачи, в которых сигнал нельзя уверенно восстановить по доступным агенту данным. Он проверяет, что вмешательство заметнее помех и отличается от альтернативных объяснений. Благодаря этому ответ можно сравнить со скрытой меткой напрямую, без экспертной разметки каждой траектории и без другой LLM в роли оценщика.
Обучение идёт в два этапа. Сначала модель донастраивают на готовых примерах расследований, чтобы она освоила формат ответа, работу с инструментами и базовую последовательность действий. Затем обучение с подкреплением поощряет правильную причину и точное совпадение затронутого сегмента.
Обучение процедуре оказалось полезнее дополнительного масштаба
Главная метрика требует, чтобы первый ответ содержал правильную причину и, где это необходимо, точный сегмент. Проверку провели на 235 отложенных эпизодах TRACE, намеренно насыщенных задачами с локальными эффектами. Сравнивали варианты Qwen3.5-35B-A3B после разных этапов обучения, более крупную Qwen3.5-122B-A10B по инструкции и несколько моделей с закрытыми весами.
Одна донастройка на примерах подняла долю полностью верных ответов до 63,7%. Более крупная Qwen3.5-122B-A10B без такого обучения получила 28,3%. В этой среде размер модели не заменил специализированный обучающий сигнал и освоенную процедуру расследования.
Обученная политика не компенсировала качество лишними запросами к инструментам. Среднее число вызовов Python и SQL сократилось с 22,05 у исходной модели до 11,73 после полного обучения. Модель научилась не только точнее выбирать причину, но и раньше останавливать поиск.
Разбор ошибок показывает границу результата. TRACE хорошо обучает причинам, заметным во всей кампании, перераспределению трафика и локальным эффектам по одному признаку. Пересечения нескольких признаков остаются сложнее, а усиление награды за точную атрибуцию заставляет модель чаще находить причину там, где симулятор не внедрял никакого сигнала.
Когда TRACE меняет план разработки агента
Работа предлагает другой порядок проектирования диагностической системы. До выбора модели стоит проверить, можно ли программно задавать причину, получать её наблюдаемые последствия и сохранять скрытую метку. Если это возможно, основным активом становится не коллекция экспертных заключений, а управляемый генератор задач с автоматической проверкой.
Симулятор при этом должен сохранять саму трудность расследования. Агенту нужны шум, правдоподобные помехи, распределённые по таблицам свидетельства и необходимость выбирать запросы. Если причина читается из одного столбца, модель выучит короткое соответствие между признаком и ответом, а не диагностическую процедуру.
Начинать сразу с обучения с подкреплением результаты не советуют. Предварительная донастройка научила модель выдавать разбираемый ответ, пользоваться инструментами и завершать расследование; последующая награда улучшила точную атрибуцию. Для продуктовой команды это означает отдельные наборы данных для освоения процесса и для оптимизации конечного решения.
Проверка пока относится к одному симулятору цифровой рекламы с заранее заданной системой причин. Поэтому она обосновывает архитектуру обучения, но не перенос качества на реальные инциденты. Для внедрения понадобятся отдельные проверки того, насколько симулятор воспроизводит рабочие данные, а агент сохраняет качество на причинах и сочетаниях условий, которые не встречал при обучении.
На практике подход подходит системам, где сбой можно безопасно внедрить или воспроизвести: диагностике программных сервисов, конвейеров данных и управляемых бизнес-процессов. TRACE показывает, что известная симулятору причина может одновременно создавать сложную задачу для агента и давать дешёвый способ проверить его ответ.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



