Журнал · Rit.work

OmniHarness сохраняет навыки визуального агента без дообучения модели

OmniHarness извлекает из удачных запусков формализованные процедуры, проверяет промежуточные шаги и переносит накопленные навыки между системами визуальной генерации.

Rit.work
Студия разработки
16 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Систему визуальной генерации научили переносить проверенные способы сборки изображений на новые задания, не меняя параметры модели. В препринте Xu Xu и коллег, который не прошёл рецензирование и где числа получили сами авторы, OmniHarness решил 95% творческих задач ComfyBench — на 27,5 процентного пункта больше лучшей альтернативы. Для продуктовой разработки это аргумент в пользу отдельного слоя с процедурами и проверками, а не только замены базовой LLM.

Как успешный запуск превращается в переносимую процедуру

OmniHarness работает поверх визуального агента, который планирует задачу и собирает исполняемый процесс из узлов ComfyUI. Система сохраняет не готовый процесс для конкретной картинки, а символическую политику — формализованный рецепт для целого семейства задач.

Из рецепта удаляют исходные изображения, частные запросы и другие данные одного запуска. Остаются последовательность действий, зависимости между ними и условия применимости. Например, политика может описывать не замену объекта в определённом кадре, а общий порядок локализации объекта, построения маски, изменения нужной области и сохранения остальной сцены.

При новом запросе планировщик ищет подходящие политики, меняет их под задачу или соединяет несколько процедур. Затем другой компонент превращает план в программу, где вызовы функций соответствуют узлам ComfyUI, а передача данных задаёт связи между ними.

Система проверяет порядок шагов и зависимости ещё до запуска. Во время исполнения она отдельно оценивает промежуточные результаты и итоговое соответствие запросу. Если один этап не сработал, OmniHarness диагностирует сбой, заменяет проблемный фрагмент и сохраняет уже проверенные части процесса.

Успешные процессы попадают в библиотеку политик, а ошибки — в отдельную библиотеку с причинами и способами исправления. Повторяющиеся рецепты объединяются, ненадёжные приостанавливаются, а статистика запусков помогает выбирать между несколькими подходящими вариантами.

Зачем агент придумывает себе учебные задачи

OmniHarness не ждёт первого пользовательского запроса, чтобы обнаружить пробел в навыках. До рабочих задач система сама предлагает упражнения для генерации и редактирования изображений, выполняет их и пополняет библиотеку проверенными процедурами.

Упражнения выбираются по двум признакам. Первый — новизна сочетания сцены и нужных возможностей. Второй — близость к границе текущих навыков: слишком простая задача почти ничему не учит, а заведомо недоступная редко даёт пригодный процесс.

Такой выбор отличает метод от обычного журнала удачных запусков. Журнал помогает повторить похожий случай, но не заставляет систему заранее закрывать неизвестные сочетания действий. OmniHarness ищет их самостоятельно и постепенно расширяет область, для которой у него есть проверенные рецепты.

Параметры базовой модели при этом остаются неизменными. Новое умение живёт в библиотеке и механизме исполнения, поэтому снимок политик можно заморозить и подключить к другому визуальному агенту. В экспериментах одни и те же политики использовались как подключаемый компонент в нескольких агентных системах, а процедуры, полученные на изображениях, применялись и в заданиях с видео.

Меняет ли OmniHarness планы продуктовых команд

Работу проверяли на шести наборах задач, трёх мультимодальных LLM и трёх системах визуальных агентов. Проверки охватывали сборку процессов ComfyUI, генерацию по тексту, редактирование изображений, задания на знания и перенос процедур между агентами; поэтому выводы относятся прежде всего к системам, где результат получают через составной и проверяемый процесс.

Разбор компонентов показывает, что выигрыш даёт не только сохранение удачных рецептов. Без самостоятельных учебных задач общая доля решённых заданий ComfyBench снизилась с 92,5% до 87%. Если убрать промежуточную проверку, доля решённых сложных заданий упала с 83,3% до 68,3%: ошибка продолжала распространяться по зависимым шагам.

Для команды, которая строит редактор, генератор рекламных материалов или внутренний конвейер обработки изображений, работа предлагает конкретную архитектуру. Стоит хранить успешные процессы в виде параметризованных процедур, явно записывать условия их применения, проверять результат после критических шагов и исправлять только сбойный участок.

Это меняет план разработки, если продукт регулярно выполняет похожие многошаговые операции. Вместо постоянного расширения подсказок или дообучения модели можно сначала проверить, даст ли сопоставимый эффект библиотека процедур поверх существующей LLM.

Для одиночных запросов к генератору вывод слабее: OmniHarness требует планировщика, исполнителя, проверяющих компонентов и накопления опыта. В статье нет расчёта стоимости такой схемы, поэтому она пока не обосновывает замену простого вызова API там, где процесс не повторяется и промежуточный результат нельзя проверить.

Источники

Иллюстрация: рисунок из статьи «OmniHarness: Harnessing Generalizable Visual Generation via Symbolic Policy Learning», Xu Xu (Beihang University), Jinxiu Liu (The Chinese University of Hong Kong), Zhangbo Qiao (Beihang University) и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу