Журнал · Rit.work

Мультимодальная модель улучшает себя, если код проверяет её данные

Замкнутый цикл обучения улучшил генерацию диаграмм, но основную прибавку дала не самооценка модели, а проверка синтетических данных через исполняемый код.

Rit.work
Студия разработки
5 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Единая мультимодальная модель стала точнее строить диаграммы после четырёх раундов обучения на собственных данных. В работе USC, UCSD и CMU, которая не прошла рецензирование и содержит собственные замеры авторов, результат на запросах с незнакомыми формулировками вырос с 45,7% до 60,2%, тогда как обычное продолжение обучения дало 46,3%. Для разработки таких систем вывод прямой: замкнуть обучение можно, но внутри цикла нужен проверяющий механизм, который не зависит от мнения самой модели.

Текстовая и визуальная части готовят данные друг для друга

Единая мультимодальная модель работает и с текстом, и с изображениями. В предложенном цикле эти способности получают разные роли: генератор рисует диаграмму по запросу, визуальная часть проверяет отдельные требования, а текстовая часть пишет программу для построения исправленного примера.

Сначала модель получает диагностические запросы и создаёт изображения. Затем она проверяет тип диаграммы, подписи, значения, цвета, порядок категорий и связи между элементами. Результаты показывают, какие свойства даются генератору хуже остальных.

После диагностики модель составляет новые задания с упором на обнаруженные слабости. Часть учебного бюджета всё равно распределяется равномерно, чтобы модель не забывала уже освоенные свойства. Сложность повышается только после того, как текущий уровень усвоен достаточно хорошо.

Текстовая часть пишет для каждого задания программу построения диаграммы. Среда запускает код и сохраняет не только изображение, но и точную запись о нарисованных данных, подписях, осях и расположении элементов. Проверка сопоставляет эту запись с исходным заданием и отбрасывает неподходящие примеры.

Принятые изображения обучают генератор. Те же изображения с точными метками, а также специально изменённые варианты обучают визуальную часть находить ошибки. Проверенные программы возвращаются в обучение текстовой части, после чего обновлённая модель начинает следующий раунд и заново определяет свои слабые места.

При использовании модель по-прежнему рисует изображение напрямую. Исполняемый код нужен только при подготовке учебных данных, поэтому метод не добавляет программный построитель в рабочий путь генерации.

Самооценка почти не помогла, исполнение кода дало прибавку

Главным оказался не выбор тем для обучения, а способ получить правильный ответ. Когда модель создавала несколько изображений и её собственная визуальная часть выбирала лучшее, результат вырос лишь на 0,5 процентного пункта. Обучение на диаграммах, которые построили и проверили через программы, добавило 8,6 пункта при тех же запросах и объёме обучения.

Причина видна в устройстве цикла. Оценщик способен заметить, что изображение неверно, но его ответ не создаёт правильную диаграмму. Более того, оценщик может пропустить ошибку и вернуть её в следующий раунд как учебный пример. Исполнение программы вместо субъективной оценки даёт точные значения и подписи, которые можно сверить со спецификацией.

Диагностика всё же приносит дополнительную пользу. Если распределять проверенные примеры не равномерно, а направлять их на текущие ошибки генератора, итоговый результат растёт ещё на 3,5 пункта. Значит, цикл решает две независимые задачи: внешний механизм отвечает за корректность данных, а сама модель выбирает, какие данные сейчас полезнее.

Визуальная часть при этом не обязана безошибочно оценивать каждую картинку. В ручной проверке она продолжала принимать часть требований, которых на изображении не было, но достаточно хорошо ранжировала группы навыков по частоте ошибок. Для планирования следующей порции данных такое ранжирование оказалось полезнее точной оценки каждого примера.

Подход годится для проверяемых форматов, а не для любого изображения

Эксперимент построили на BAGEL-7B-MoT и диаграммах нескольких типов. Для оценки создали BasicChartBench: одна часть меняла формулировки запросов, другая добавляла редкие слова, новые числовые форматы и более сложное содержимое. Итоговые изображения оценивал зафиксированный исходный читатель модели, а отдельная модель Qwen3.6-35B-A3B подтвердила направление изменений.

На более сложном наборе StructT2IBench результат изменился только с 11,0% до 11,9%. Общее качество генерации изображений сохранилось, но результат визуального понимания на MMBench снизился на 2,6 пункта. Это не демонстрация универсального самосовершенствования: цикл улучшал узкий формат с формальной спецификацией, а перенос за его пределы остался слабым.

Работа меняет планы команд, которые генерируют документы, таблицы, схемы, отчёты или другую структурированную графику. Для таких задач можно разделить систему на диагноста, конструктор примеров и независимый проверяющий механизм. Проверяющим может служить исполнение кода или другой детерминированный процесс, который возвращает точное состояние результата.

Использовать ту же модель и для генерации, и как единственный источник правильности рискованно: отбор лучшего из собственных ответов почти не сдвинул качество. Практический приоритет — сначала формализовать спецификацию и автоматическую проверку, затем направлять синтетические данные на измеренные ошибки. Без первого шага рекурсивный цикл будет закреплять неточности быстрее, чем исправлять их.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу