Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Проверка агентов, которые управляют интерфейсом и пишут код, показала: они точнее копируют статичную структуру приложения, чем его реакции на действия и результаты вычислений. В RecreationBench GPT-6 Astra набрал 58,1%, но прошёл все программные проверки лишь в 2,8% задач, хотя работа пока не рецензирована и числа получили сами авторы. Для разработки таких агентов это сдвигает цель с отдельных навыков работы с GUI и терминалом на полный цикл исследования, реализации и самопроверки.
Копирование приложения связывает интерфейс и код в одной задаче
Обычные тестовые наборы часто разделяют работу с компьютером на два класса задач. В одном агент видит экран, нажимает кнопки и вводит текст. В другом он пишет код, запускает сборку и исправляет ошибки через командную строку.
RecreationWorld соединяет эти режимы. Агент получает краткое описание задачи, доступ к работающему приложению-образцу и среду разработки. Он должен исследовать экраны и переходы, восстановить требования по наблюдаемому поведению, написать собственную реализацию, запустить её и сравнить с образцом.
Порядок действий не задан. Агент может вернуться к образцу после начала разработки, проверить гипотезу через интерфейс или открыть свою сборку и исправить найденное визуальное расхождение. Медианная траектория в RecreationBench содержит 282,5 вызова инструментов, поэтому среда проверяет сохранение контекста на длинной последовательности действий, а не выполнение одного запроса.
Результатом служит исходный код, который собирается и запускается по правилам целевой платформы. Совпадение архитектуры или структуры файлов не требуется: оценивается наблюдаемое поведение. Среда поддерживает Ubuntu, macOS, Windows, Android и Web, сохраняя для каждой платформы штатные способы управления интерфейсом и автоматизации.
Такая постановка ближе к разработке через исполняемый образец, чем к генерации интерфейса по снимку. Агенту недостаточно воспроизвести расположение элементов: он должен выяснить, что происходит после ввода данных, перехода между экранами, сохранения состояния или запуска вычисления.
Скрытые тесты проверяют последствия действий
Работающее приложение-образец одновременно служит спецификацией и источником ожидаемых результатов. Создатели RecreationWorld выполняют в нём действия, фиксируют ответы и превращают их в скрытые проверки, которые затем без изменений запускают на реализации агента.
Программные проверки считывают точный текст, состояние элементов и результат действий через системные средства доступности и автоматизации. Визуальные проверки дополняют их там, где важны расположение, отрисовка холста и другие свойства, которых нет в структурированном описании интерфейса.
Каждая проверка связывает исходное действие с его последствием. Набор охватывает как простую смену состояния после одного шага, так и переходы между экранами, сохранение данных и сквозные вычисления. Перед включением проверка должна успешно отработать на образце и пройти ручную проверку, после чего весь набор фиксируют.
RecreationBench включает 250 задач на разных платформах, с разными системами сборки и средствами автоматизации. Среди десяти проверенных моделей лучший общий результат показал GPT-6 Astra, однако полный программный проход остался редким. Анализ ошибок показывает устойчивый разрыв: статичный каркас интерфейса воспроизводится надёжнее, чем интерактивная логика и вычисляемые результаты.
Границы оценки задают закреплённые версии воспроизводимых приложений и конечный набор скрытых сценариев. Поэтому успешный проход подтверждает совпадение в проверенных состояниях, но не равен полной функциональной эквивалентности. Часть приложений имеет открытый исходный код, и проверка пересечений не может полностью исключить знакомство модели с ним во время предварительного обучения.
Что RecreationWorld меняет в плане разработки агента
Работа сильнее влияет на планы команд, которые создают агентов для разработки и управления приложениями, чем на планы внедрения готовых автономных систем. Она даёт общий контур для трёх ранее раздельных компонентов: штатного управления GUI, инструментов разработки и проверки запущенного результата.
Из среды следуют практические требования к архитектуре. Агенту нужен единый журнал действий между интерфейсом и кодом, возможность сохранять состояние долгой задачи и отдельный шаг визуальной проверки собственной сборки. Оценивать такой агент только по тому, собрался ли проект или совпал ли снимок экрана, недостаточно: скрытые сценарии должны запускать действия и проверять их последствия.
RecreationWorld можно использовать и как источник учебных траекторий. Для эксперимента отобрали 35 000 запусков с разных платформ и обучили на них два варианта модели. Оба улучшили результат на пяти внешних тестовых наборах для программирования и управления компьютером; максимальный прирост составил 17,9 процентного пункта. Это начальное свидетельство, что навык исследования и проверки переносится за пределы копирования приложений.
Результаты пока не поддерживают план, в котором агенту без контроля поручают целиком воспроизводить рабочий продукт: даже лидер редко реализует всё проверяемое поведение. Зато RecreationWorld даёт более строгий промежуточный рубеж для разработки — агент должен не просто написать код, а самостоятельно обнаружить требования, запустить результат и найти расхождения через тот же интерфейс, которым пользуется человек.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



