Журнал · Rit.work

RSIAgent адаптирует ИИ-агента без дообучения модели

RSIAgent исследует новую цифровую среду, сохраняет проверенные правила в памяти и повышает результат агента без изменения параметров модели.

Rit.work
Студия разработки
15 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

RSIAgent научили самостоятельно осваивать незнакомые цифровые среды и переносить найденные правила на новые задания без изменения параметров модели. В нерецензированном препринте, где все числа получили сами авторы, средний частичный балл вырос на 7,01 процентного пункта в OSWorld 2.0 и на 1,07 пункта в Agents’ Last Exam. Такой подход позволяет адаптировать агента к частной или меняющейся системе через память, а не через новый цикл обучения.

Система разделяет работу между тремя агентами. Агент учебной программы выбирает, что исследовать дальше, исполнитель управляет программами через исполняемый код, а проверяющий сверяет результат с состоянием среды. После проверки исполнитель записывает в постоянную память полезные процедуры, ограничения и связи между действием, условием и последствием.

Исследование идёт в два этапа. Сначала несколько исполнителей параллельно пробуют разные типы задач и собирают широкую карту интерфейсов, инструментов и типичных сбоев. Затем система последовательно разбирает сложные случаи, скрытые условия и границы применимости найденных правил. Перед итоговыми заданиями память замораживают: агент может читать её, но больше не меняет.

На OSWorld 2.0 проверили 82 задания, в которых агент управляет прикладными программами. Agents’ Last Exam добавил 67 интерактивных заданий. Частичный балл здесь показывает, какую долю требований задачи выполнила система, а бинарная точность учитывает только полностью завершённые задачи.

RSIAgent сравнивали с той же агентной обвязкой без самостоятельного исследования. На четырёх отдельно разобранных заданиях сочетание широкого и глубокого этапов каждый раз давало лучший частичный балл, чем любой этап по отдельности. При подсчёте общего результата для заданий без завершённого исследования сохраняли исходные баллы, поэтому эксперимент показывает эффект накопленной памяти, но не одинаковый бюджет адаптации для каждой задачи.

Практическая граница метода проходит по доступу к проверяемой среде. Агенту нужны наблюдаемые результаты действий, чтобы независимый проверяющий мог отсеивать ошибки; одной истории рассуждений исполнителя для обновления памяти недостаточно.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу