Журнал · Rit.work

Опыт эксплуатации пока не учит ИИ-агентов без отката

ServeLearnBench показал разрыв между способностью ИИ-агента выполнить задачу по известным правилам и умением самостоятельно вывести эти правила из опыта.

Rit.work
Студия разработки
7 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Агенты пока не умеют надёжно выводить скрытые правила из опыта эксплуатации и пересматривать их после изменения среды. Хотя препринт не рецензирован и числа получили сами авторы, в сложном сценарии розничной поддержки лучший агент набрал 59,6% против 95,5% у модели, которой сразу раскрыли правила. Значит, автоматическое обучение на рабочих запросах пока нельзя считать заменой явному обновлению инструкций и проверкам на откат качества.

ServeLearnBench имитирует поток задач, где внутренние правила меняются, но агенту об этом не говорят. После каждого рабочего запроса он получает только результат, а не правильный ответ: например, узнаёт, удалось ли отменить заказ, но не видит действующее условие отмены. Затем агент решает новые задачи без обратной связи, поэтому простое запоминание примеров не помогает.

Проверка охватила 7 718 задач из трёх областей: розничной поддержки, банковских проверок и подготовки коммерческих предложений. Исследователи сравнили 28 сочетаний моделей и механизмов обучения, включая RAG, Mem0, SkillOpt, Continual Harness и Prime. Скрытые правила могли появляться, исчезать и снова вступать в силу, а отдельные задания полностью описывали правильное действие и не требовали обучения.

Адаптация требовала в 4–101 раз больше вычислительных затрат, чем работа с раскрытым правилом. При этом накопленный опыт иногда портил ответы, которые модель раньше давала правильно: у GLM-5.3 Flash с Continual Harness результат на полностью описанных задачах снизился с 96,7% до 82,8%. Механизм обучения перенёс предположения о скрытой политике туда, где достаточно было следовать явной инструкции.

Лучше работали механизмы, которые после неудачи пробовали разные действия, а не повторяли первый вариант. Но одного успешного ответа тоже недостаточно: часть систем находила верное действие и затем не могла стабильно применить его снова. Для архитектуры продукта из этого следует разделять исследование правил и основной контур обслуживания, хранить версии накопленного опыта и перед выпуском каждой адаптации повторно проверять задачи, которые агент уже решал правильно.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу