Журнал · Rit.work

OpenGameEval оценивает, как ИИ-агент исследует код и сцену

OpenGameEval показал, что средний процент решённых задач скрывает различия между агентами, а изучение нужных объектов перед правкой связано с более частым успехом.

Rit.work
Студия разработки
5 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

В OpenGameEval научились отдельно измерять, исследовал ли программирующий агент среду перед правкой, а не только выполнил ли он задачу. Хотя препринт Roblox не рецензирован и числа получили сами авторы, лучший результат составил 51,7% задач с одной попытки и 39,4% при требовании пройти задачу пять раз из пяти. Одного среднего показателя недостаточно, чтобы выбрать модель для работы со сложным проектом.

Агент работает внутри Roblox Studio: ищет объекты в иерархии, читает существующие скрипты, меняет сцену и пишет код. OpenGameEval разделяет инструменты наблюдения и изменения, а затем проверяет как сохранённую сцену, так и поведение запущенной игры с физикой и взаимодействием клиента с сервером.

Для каждой задачи размечены объекты и скрипты, которые использует эталонное решение. Это позволяет считать, какую долю нужных зависимостей агент изучил до того, как начал их менять. На задачах только со сценой переход от нулевого к полному просмотру зависимостей связан с ростом вероятности успеха на 13,4 процентного пункта, а на задачах только со скриптами — на 9,8 процентного пункта.

Такой показатель раскрывает различия, которые скрывает итоговый процент. Модели могут решить одинаковую долю задач, но одна сначала находит нужные части проекта, а другая быстрее переходит к правкам и чаще угадывает. Метрику можно применять при испытаниях агентов для репозиториев, редакторов и других сред с изменяемым состоянием: для этого инструменты нужно разделить на наблюдение и действие, а задачи — снабдить эталонными зависимостями.

Проверка охватила 13 моделей, 84 основные задачи и 16 попыток на каждую пару модели и задачи. Все агенты получили одинаковые инструменты и системную инструкцию. Результаты относятся к Roblox Studio, языку Luau и агентам, которые воспринимают среду только через текст; связь между исследованием и успехом пока показывает полезный сигнал для оценки, но не доказывает, что награда за исследование сама улучшит модель.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу