Журнал · Rit.work

RSIGym даёт ИИ-агентам среду для улучшения моделей и обвязки

RSIGym отделяет обучение, оценку и запуск моделей от рабочего пространства агента, чтобы сравнивать его исследовательские решения при общем бюджете.

Rit.work
Студия разработки
8 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

ИИ-агент смог сам улучшать обучающие данные, настройки модели и исполняющую обвязку, проверяя варианты в общей исследовательской среде. Команда Evolvent AI и National University of Singapore описала результат в препринте, который не прошёл рецензирование, и сама получила все числа: лучший агент закрыл 48,09% разрыва между исходным и максимальным результатом. Такая схема позволяет сравнивать исследовательские решения агентов, а не их умение настраивать инфраструктуру.

В RSIGym агент работает в лёгком контейнере без GPU. Обучение, запуск моделей, генерацию данных, оценку и изолированные вычисления выполняют удалённые сервисы. Общая система авторизации проверяет права, списывает расходы из единого бюджета и сохраняет вызовы независимо от отчёта агента. Поэтому кандидат можно обучить, подключить к обвязке, проверить и заменить, не разворачивая инфраструктуру заново.

Лучший результат показал Opus 5 при лимите $500 на один запуск для каждого бенчмарка. На SWE-bench Verified итоговая система подняла долю решённых задач с 17,67% до 50,33%, а на AIME — с 31,67% до 97,78%. RSI-Index усредняет долю закрытого разрыва до максимального результата, поэтому разные типы задач получают одинаковый вес.

Среду проверили на шести исследовательских моделях и пяти бенчмарках: SWE-bench Verified, Terminal-Bench 2.0, AIME, GPQA Diamond и SkillsBench. Все модели начинали с одной базовой модели и минимальной обвязки, а в совместном режиме могли менять данные, параметры обучения и исполняющий код. Эксперименты измеряют улучшение целевой системы внутри отдельного запуска; они ещё не показывают, что принятое изменение помогает агенту эффективнее проводить следующий цикл исследований.

Для команд, которые строят автономные исследовательские системы, RSIGym предлагает практическое разделение: агент принимает решения, а платформа выдаёт вычисления через контролируемые сервисы. Это упрощает повторение экспериментов, ограничивает расходы и оставляет журнал, по которому можно разобрать не только итоговый балл, но и путь к нему.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу