Журнал · Rit.work

GAI проводит границу между улучшением политики и самоулучшением агента

GAI объединяет обычное улучшение политики и рекурсивное самоулучшение в одной схеме и показывает, когда агент получает доступ к механизму обновления и критерию успеха.

Rit.work
Студия разработки
15 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Итеративное улучшение политики и рекурсивное самоулучшение агента удалось описать как один цикл с двумя меняемыми условиями. Hongyao Tang, Yi Ma, Pengyi Li и Yifu Yuan предложили схему GAI; препринт не прошёл рецензирование, а приведённые числа получили сами авторы. Схема помогает определить, когда система перестаёт просто улучшать поведение и начинает менять механизм собственного обновления.

GAI считает агентом все части системы, которые разрешено изменять: политику, то есть правило выбора действий, оценщики, механизм изменения и эталон оценки. Система по очереди оценивает текущую конфигурацию и предлагает следующую. Обычное обучение и самоулучшение различаются не устройством цикла, а тем, какие его части доступны для перезаписи.

Первое условие показывает, входит ли механизм изменения в агента. Если он остаётся снаружи, получается классическое итеративное улучшение политики GPI. Если агент может переписать механизм, который подготовит его следующее обновление, цикл становится рекурсивным.

Второе условие определяет, где закреплён критерий успеха. Внешний и неизменяемый эталон удерживает систему на исходной цели. Если агент может менять эталон, возникает дрейф цели; если внешнего эталона не остаётся, система оценивает себя относительно собственных правил. Для агента-программиста разница выглядит буквально: неизменяемые тесты закрепляют цель, доступные для редактирования тесты позволяют подогнать проверку, а собственное суждение агента замыкает оценку на нём самом.

Из схемы следуют четыре класса проблем: дорогой и немонотонный поиск новой версии агента, самооценка изменяемым оценщиком, потеря внешней опоры и дрейф цели. Классическая гарантия сходимости GPI действует только в конечной среде с фиксированными правилами обновления и внешней наградой; переносить её на рекурсивные системы нельзя.

GAI применяют к известным архитектурам от DQN и Reflexion до STOP и Gödel Agent. Это теоретическая классификация автономных систем: она описывает устройство обновлений и места, где заканчиваются прежние гарантии, но не оценивает стоимость вычислений или достижимый прирост качества.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу