Журнал · Rit.work

VERA учит агента и переписывает его рабочие навыки по одной шкале

VERA превращает длинные рабочие процессы в проверяемые этапы и поочерёдно улучшает модель и её набор навыков, опережая обучение только одного компонента.

Rit.work
Студия разработки
7 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Агента для длинных задач научили улучшать и собственное поведение, и рабочие навыки по результатам промежуточных шагов. Команда Junqi Liu назвала систему VERA; в работе, которая пока не рецензирована и содержит замеры самих авторов, она обошла лучший подход с изменением только одного компонента на 10,3 и 13 баллов в двух областях. Для разработки таких агентов это переносит основной акцент с алгоритма обучения на устройство проверяемой рабочей среды.

VERA превращает готовые траектории задач в песочницы, которые можно перезапустить с одного из пяти этапов: от составления плана до сдачи результата. Для каждого этапа агент пишет набор двоичных критериев, исполняемый код проверяет состояние инструментов и файлов, а модель-оценщик изучает рабочую область. Если программная проверка не пройдена, её результат имеет приоритет над оценкой модели; в обучающий набор попадают только песочницы, где успех подтверждается наблюдаемыми следами работы.

Обычное обучение с подкреплением меняет веса модели по итоговой награде. VERA поочерёдно обучает модель и редактирует её набор навыков, каждый раз замораживая второй компонент. Отчёт по ошибкам указывает проблемный этап, после чего система либо обучает модель на промежуточных наградах, либо добавляет, объединяет или удаляет навык. Изменение навыка принимают только после парных прогонов: оно должно улучшить целевой этап и не ухудшить задачу целиком.

Авторы собрали более 9000 сред и проверили подход на AutoCoWorkBench и AutoMedBench с моделями на 4, 9 и 27 млрд параметров. Полное сравнение с альтернативными методами провели только для модели на 9 млрд параметров; перенос отдельно оценили на Automation-Bench и AgentClinic. Проверка, выставление оценок и разбор ошибок зависят от GPT-5.6-Sol, влияние другой модели-оценщика не изучали.

Практический шаблон здесь состоит из возобновляемого состояния, критериев для каждого этапа, программных проверок и отдельной приёмки изменений. Подготовка сред составила 54,7% расчётной стоимости медицинского контура, а один запуск совместного обучения модели на 27 млрд параметров потребовал примерно 5000–8000 GPU-часов. Значит, бюджет такого проекта определяют не только вычисления, но и создание среды, которая способна доказать, где именно агент ошибся.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу