Журнал · Rit.work

Atria Dawn: агент ведёт проект, человек сохраняет право решения

Atria Dawn связывает действия агента с исполняемой средой и внешней проверкой, а опыт разработки показывает, какие решения пока остаются за человеком.

Rit.work
Студия разработки
15 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Atria Dawn Preview научили самостоятельно вести целые исследовательские и инженерные задачи, а не только выполнять отдельные поручения. В препринте Honglin Guo, Tao Gui и соавторов, который не прошёл рецензирование и где числа получили сами авторы, модель показала лучший заявленный результат в пяти из 16 тестов. Для команд важнее сам производственный контур: агент выполняет длинную цепочку действий, но человек по-прежнему задаёт направление и принимает решения.

Как исполнение превращают в обучающий опыт

Atria Dawn построена на базовой модели со смесью экспертов объёмом 744 миллиарда параметров. Для обучения авторы разработали Verifiable Experience Pipeline — процесс, который связывает задачу, действия агента, созданные материалы и независимо проверяемый результат.

Каждая задача выполняется в реальной среде. Агент видит её состояние, вызывает инструменты, изучает ответы, создаёт промежуточные файлы и меняет план после обратной связи. Это отличает процесс от обучения на готовых диалогах, где модель видит текст решения, но не сталкивается с последствиями собственных действий.

Способ проверки зависит от задачи. Код запускают через тесты, эксперимент оценивают по метрикам, работу с приложением — по состоянию файлов и самой программы. Для чертежей проверяют геометрию, для исследовательских отчётов — наличие подтверждающих источников. Если результат нельзя выразить формальным правилом, используют заранее заданные человеком критерии.

После запуска процесс отбрасывает незавершённые, противоречивые, повторяющиеся и поведенчески некорректные примеры. Неудачный запуск тоже может стать материалом для обучения, если его итог установлен независимо: например, тест точно показывает ошибку, а журнал сохраняет действия, которые к ней привели.

Повторяющиеся сбои влияют на следующие задания и устройство среды. Если агент выбирает неподходящий инструмент, пропускает проверку или не восстанавливается после ошибки, команда добавляет соответствующие сценарии и проверки. Цель такого цикла — научить модель не конкретному ответу, а повторяемому поведению: проверить состояние, прочитать обратную связь, исправить план и снова подтвердить результат.

Сильные результаты не означают одинакового качества во всех задачах

На AutomationBench модель набрала 53,8 балла против 49,7 у ближайшего результата. Она также вышла на первое место в тестах вызова инструментов, глубокого поиска, работы с браузером и кибербезопасности. В разработке ПО, терминальных задачах и подготовке профессиональных материалов другие модели оставались впереди.

Проверка охватывала поиск и исследования, работу с офисной средой, программирование, машинное обучение и безопасность. Места в таблице считались только среди доступных результатов сравниваемых моделей, поэтому первое место не означает победу над каждой системой в одинаковых условиях.

Приведённые практические случаи показывают устройство работы, а не среднюю вероятность успеха. Atria Dawn обрабатывала погодные данные, собирала операционную систему с сохранением состояния, оптимизировала код для GPU и исправляла уязвимость в изолированной среде. При этом интерфейс прогноза не подтверждал его точность, а изображения деталей не служили проверкой пригодности к производству.

Командам придётся проектировать контур решений, а не только набор заданий

Разделение ролей изучали на 769 записях о задачах от 56 участников разработки Atria Dawn. Агент предложил 64,6% рассмотренных методов и вариантов, но человек принял окончательное решение в 85,5% случаев. Когда работа сталкивалась с существенной трудностью, вмешательство человека помогло продолжить её в 76% задач.

Это и есть переход от выполнения отдельных поручений к участию в проекте. Агент уже может предложить метод, запустить эксперимент, изучить журнал, изменить реализацию и подготовить следующую версию. Человек реже пишет каждый шаг, но всё ещё определяет цель, добавляет недостающий контекст, диагностирует тупик и выбирает вариант для продолжения.

Для команды, которая строит долгоживущих агентов, работа меняет состав платформы. Исполняемая среда, журнал действий, промежуточные материалы и внешняя проверка становятся такими же обязательными частями системы, как модель и запрос к ней. Без них нельзя понять, достигнут ли результат и почему агент изменил план.

Точки человеческого контроля стоит размещать не перед каждым вызовом инструмента, а там, где меняются цель, метод, ресурсы или критерий готовности. Исполнение можно передать агенту, если команда сохраняет возможность проверить итог, остановить процесс и выбрать другое направление.

Работа не подтверждает, что агент способен самостоятельно улучшать исследовательский процесс. Большинство новых целей задавали люди, а опыт неудачного запуска часто оставался внутри одной сессии, пока исследователь не переносил вывод в следующую задачу. Поэтому ближайший практический шаг — не убирать человека из цикла, а превращать его редкие решения в проверяемые правила, новые сценарии и изменения среды.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу