Журнал · Rit.work

ReLiveGym проверяет, когда долгоживущий агент решает действовать

ReLiveGym оценивает LLM-агентов в меняющейся среде и показывает, почему выбор момента действия и обратная связь важны не меньше самой модели.

Rit.work
Студия разработки
2 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

ReLiveGym позволяет проверять, способен ли LLM-агент неделями следить за меняющейся обстановкой и действовать вовремя, а не просто завершать длинную задачу в статичной среде. В нерецензированном препринте, где числа получены самими авторами, выбор момента действия оказался отдельным фактором качества наряду с выбором модели. Для продукта это переносит часть оценки с самой LLM на управляющий контур, который решает, когда запускать агента и как учитывать прошлые ошибки.

Xisen Jin с соавторами собрали среду, которая хронологически воспроизводит реальные потоки новостей, рыночных данных и публикаций в социальных сетях. Агент наблюдает за ними в течение смоделированных недель, но действует лишь время от времени. Задания различаются по срочности, сложности рассуждений и необходимости повторять действия.

Главный результат касается механизма запуска. Одинаковое правило выбора момента не подходит всем заданиям, а лучший вариант иногда зависит и от базовой модели. Поэтому сравнение только итоговых ответов LLM не показывает, насколько надёжно агент будет работать без оператора: тестировать нужно всю связку, включая расписание проверок и условия, при которых система решает вмешаться.

В ReLiveGym также проверили непрерывное обучение на обратной связи о прошлых результатах. Такая обратная связь влияет на качество и помогает исправлять сбои, которые накапливаются в долгих задачах. Это отделяет долгоживущего агента от обычной цепочки запросов: его поведение зависит не только от текущего контекста, но и от того, как система использует последствия прежних решений.

Проверка охватила восемь базовых языковых моделей и задачи на потоках трёх типов. Поскольку материал подготовлен только по абстракту, из него нельзя восстановить точные задания, схему оценки и величину различий между вариантами. Работа поэтому задаёт полезную структуру испытаний, но не позволяет выбрать конкретную модель или механизм запуска по опубликованным в абстракте результатам.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу