Журнал · Rit.work

SVG-Score проверяет, соответствует ли сгенерированный SVG текстовому заданию

Авторы SVG-Score обучили два оценщика генерации SVG на человеческих оценках и показали, почему обычные метрики для изображений пропускают ошибки в цветах, количестве объектов и их расположении.

Rit.work
Студия разработки
4 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Исследователи из Hasso-Plattner Institute и University of Modena and Reggio Emilia представили SVG-Score, хотя работа опубликована как препринт и не проходила рецензирования. По замерам авторов, обученные на человеческих оценках модели лучше согласуются с людьми, чем обычный CLIPScore и готовые визуально-языковые модели. Работа важна командам, которые генерируют и автоматически проверяют иконки, схемы, логотипы и другие SVG по текстовому заданию.

Что сделали

Авторы рассматривают семантическое соответствие: присутствуют ли в SVG нужные объекты, совпадают ли их цвета и количество, правильно ли переданы пространственные отношения. Это отличается от общей визуальной привлекательности и сходства с растровыми изображениями.

Сначала исследователи проверили распространённые оценщики с помощью контролируемых искажений. В подписях заменяли цвета, количество объектов и пространственные отношения, не меняя сам SVG. Отдельно изображение подменяли однотонным фоном или набором цветных кругов. Хороший оценщик должен сильнее штрафовать пару, в которой текст перестал соответствовать содержанию.

Затем авторы собрали набор человеческих оценок. Каждая пара из подписи и SVG получала балл по шкале от 1 до 5: от отсутствия связи с заданием до точного соответствия.

На этих данных обучили два типа оценщиков. Первый основан на CLIP: его предварительно адаптировали к векторной графике на 3,2 млн пар SVG и подписей, а затем настроили на человеческие предпочтения. Такой вариант выдаёт числовую близость изображения и текста и рассчитан на массовую проверку результатов.

Второй оценщик построен на Qwen3-VL-8B. Это визуально-языковая модель (VLM), которая получает изображение и подпись, формулирует краткое обоснование и выставляет балл. Её последовательно обучали на размеченных примерах и дополнительно настраивали обучением с подкреплением, вознаграждая близость к человеческой оценке и правильное ранжирование SVG для одной подписи.

Что показали

В контролируемых тестах обычный CLIP почти не снижал оценку после замены количества объектов или пространственных отношений. Изменение цвета влияло сильнее, но существенно слабее, чем грубая подмена всего изображения геометрической заглушкой. Это означает, что высокая оценка CLIP сама по себе не подтверждает точное выполнение составного задания.

Готовая Qwen3-VL-8B без дополнительного обучения лучше реагировала на смысловые ошибки, но неравномерно. На чёрно-белой графике её чувствительность к количеству и расположению объектов снижалась. Обученный авторами VLM-оценщик лучше согласовывался с человеческими баллами и превзошёл рассмотренные готовые модели-оценщики; адаптация CLIP к SVG и последующая настройка на предпочтениях также улучшали согласие.

В отдельном сравнении генераторов Claude Sonnet 5 занял первое место у 6 из 7 оценщиков. Среди открытых моделей лидировал HiVG, хотя один из методов рисования, VectorFusion, получил более высокий балл обученного VLM-оценщика. У IntroSVG доля отсутствующих, прозрачных или неотрисовываемых результатов достигла 33,17%, поэтому семантическую оценку авторы дополнили проверкой технических сбоев.

Ограничения

Работа оценивает соответствие отрисованного SVG подписи, но не качество исходной структуры файла: редактируемость контуров, сложность разметки, доступность, размер документа и пригодность к дальнейшей обработке здесь не измеряются. Эстетика также не входит в заявленный критерий.

Человеческая разметка охватывает 8 671 SVG и 1 858 подписей из OmniSVG; оценки собирали у 5 аннотаторов. Проверка чувствительности к искусственным искажениям проведена на 200 SVG, а независимый рейтинг генераторов — на 1 616 автоматически составленных и затем проверенных человеком подписях. Поэтому результаты не показывают, как оценщики поведут себя на фирменных наборах конкретной компании, других стилях иллюстраций или требованиях к SVG-коду.

Авторы сравнили свои модели с CLIP-подобными метриками, готовыми VLM и VectorGym, но в работе нет замеров стоимости и скорости оценивания. Итоговый рейтинг генераторов рассчитан автоматическими оценщиками, а не через прямое человеческое сравнение всех результатов независимого набора.

Что это значит

Работа не даёт достаточных оснований немедленно менять выбранный генератор SVG: рейтинг зависит от предложенного критерия, а эксплуатационные свойства систем не сравниваются. Она меняет план оценки продукта. Если проверка сейчас ограничена CLIPScore, этот показатель может пропускать ошибки, которые заметны пользователю и критичны для выполнения задания.

Практическая схема следует из разделения двух оценщиков. Адаптированный CLIP подходит для первичного ранжирования большого потока вариантов, поскольку сводит проверку к сравнению представлений текста и изображения. Обученный VLM уместен на следующем этапе, где нужны оценка составных требований и объяснение причины низкого балла. Человеческая проверка остаётся необходимой для собственной предметной области и требований, которых нет в критерии SVG-Score.

Для новой системы генерации стоит заранее включить в проверочный набор задания на цвета, количество и взаимное расположение объектов, отдельно учитывать ошибки отрисовки и не смешивать семантическое соответствие с эстетикой или качеством SVG-кода. SVG-Score в таком процессе выступает не заменой приёмочного тестирования, а основой для более предметной автоматической проверки.

Источники

Иллюстрация: рисунок из статьи «SVG-Score: Human-Aligned Evaluation of Text-to-SVG Generation», Marco Cipriano, Leonardo Zini, Alexandra Schild и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу