Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Агенты пока не умеют надёжно выводить скрытые правила из опыта эксплуатации и пересматривать их после изменения среды. Хотя препринт не рецензирован и числа получили сами авторы, в сложном сценарии розничной поддержки лучший агент набрал 59,6% против 95,5% у модели, которой сразу раскрыли правила. Значит, автоматическое обучение на рабочих запросах пока нельзя считать заменой явному обновлению инструкций и проверкам на откат качества.
ServeLearnBench имитирует поток задач, где внутренние правила меняются, но агенту об этом не говорят. После каждого рабочего запроса он получает только результат, а не правильный ответ: например, узнаёт, удалось ли отменить заказ, но не видит действующее условие отмены. Затем агент решает новые задачи без обратной связи, поэтому простое запоминание примеров не помогает.
Проверка охватила 7 718 задач из трёх областей: розничной поддержки, банковских проверок и подготовки коммерческих предложений. Исследователи сравнили 28 сочетаний моделей и механизмов обучения, включая RAG, Mem0, SkillOpt, Continual Harness и Prime. Скрытые правила могли появляться, исчезать и снова вступать в силу, а отдельные задания полностью описывали правильное действие и не требовали обучения.
Адаптация требовала в 4–101 раз больше вычислительных затрат, чем работа с раскрытым правилом. При этом накопленный опыт иногда портил ответы, которые модель раньше давала правильно: у GLM-5.3 Flash с Continual Harness результат на полностью описанных задачах снизился с 96,7% до 82,8%. Механизм обучения перенёс предположения о скрытой политике туда, где достаточно было следовать явной инструкции.
Лучше работали механизмы, которые после неудачи пробовали разные действия, а не повторяли первый вариант. Но одного успешного ответа тоже недостаточно: часть систем находила верное действие и затем не могла стабильно применить его снова. Для архитектуры продукта из этого следует разделять исследование правил и основной контур обслуживания, хранить версии накопленного опыта и перед выпуском каждой адаптации повторно проверять задачи, которые агент уже решал правильно.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



