Журнал · Rit.work

GeoWeave связывает вспомогательный чертёж с ходом решения

GeoVAD-Bench отделяет пользу готовых вспомогательных построений от ошибок автогенерации, а GeoWeave-8B улучшает не только ответы, но и промежуточные шаги решения.

Rit.work
Студия разработки
14 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Модель научили решать геометрические задачи через собственные вспомогательные чертежи, не теряя связь между дорисованной линией и доказательством. Хотя препринт не рецензирован и все числа получили сами авторы, GeoWeave-8B повысила точность ответов базовой модели на 25,3 процентного пункта. Работа предлагает командам проверять не качество картинки отдельно, а весь путь от чтения исходной схемы до использования нового элемента в рассуждении.

Как GeoVAD-Bench находит сломанный шаг

Работу подготовила команда Southeast University, Ant Group и Key Laboratory of New Generation Artificial Intelligence Technology. Она ввела GeoVAD-Bench — набор задач для диагностики визуальной цепочки рассуждений (Visual Chain-of-Thought), в которой модель может менять изображение по ходу решения.

Для каждой задачи предусмотрены три режима. В No-Aux модель видит только исходную схему. В Auto-Aux она сама решает, что дорисовать, создаёт новый визуальный вариант и продолжает рассуждать по нему. В GT-Aux модель получает проверенный экспертами вспомогательный чертёж.

Такое разделение показывает разницу между потенциальной пользой построения и способностью модели выполнить его самостоятельно. Если GT-Aux улучшает ответы, а Auto-Aux нет, проблема лежит не в самой идее вспомогательной линии, а в планировании, редактировании изображения или чтении изменённой схемы.

Каждую траекторию оценивают по пяти признакам:

  • Восприятие исходной схемы. Модель не должна приписывать рисунку точки, линии и отношения, которых там нет.
  • Качество вспомогательного чертежа. Исходные элементы должны сохраниться, а добавленные — соответствовать инструкции модели.
  • Использование нового состояния. Следующие шаги должны ссылаться на дорисованные элементы и применять их в доказательстве.
  • Корректность рассуждения. В решении не должно быть явных геометрических, логических или вычислительных ошибок.
  • Правильность ответа. Этот показатель проверяют отдельно от качества промежуточного процесса.

В тест вошли 600 задач, где требуется вспомогательное построение. Они охватывают китайский и английский языки, разные уровни сложности, задания с выбором ответа и открытые задачи. Для моделей без встроенной генерации изображений применяли связку: языковая модель формулировала команду, внешний редактор менял схему, после чего языковая модель читала результат.

Дообучение исправляет цепочку, а не только ответ

Диагностика показала каскадную природу ошибок. Модель может правильно понять исходную схему, но повредить её при редактировании; может хорошо провести линию, но не сослаться на неё; может использовать новый элемент, а затем допустить ошибку в доказательстве.

Под эти этапы собрали отдельные обучающие данные: для точного восприятия геометрии, редактирования диаграмм и чередования текста с визуальными состояниями. GeoWeave-8B сначала прошла трёхэтапное дообучение с учителем, где способности осваивались последовательно, а затем обучение с подкреплением на полной траектории решения.

Награду также привязали к отдельным шагам, чтобы итоговый правильный ответ не скрывал слабое рассуждение. Модель получала сигнал не только за завершённую задачу, но и за качество промежуточного процесса.

По сравнению с SenseNova-U1-8B средний результат по четырём промежуточным признакам вырос на 30,4 процентного пункта. Качество вспомогательного чертежа прибавило 51,0 пункта, корректность рассуждения — 43,0, использование чертежа — 22,0, а восприятие исходной схемы — 5,8. Последний прирост меньше, поскольку базовая модель уже сравнительно хорошо читала исходные изображения.

Поэтапные проверки обучения дают практическую деталь: дообучение с учителем сильнее всего исправляло редактирование схем, а награда за отдельные шаги заметнее влияла на последующее доказательство. Одной общей оценки за ответ оказалось недостаточно, чтобы выровнять оба навыка.

Менять архитектуру рано, порядок проверки — уже стоит

Работа меняет прежде всего план оценки таких систем. Точность финального ответа не показывает, помог ли созданный чертёж, оказался бесполезным или случайно сопровождал верное решение. Для отладки нужно сохранять исходную схему, команду на редактирование, полученное изображение и тот фрагмент рассуждения, где модель использовала новый элемент.

Сравнение Auto-Aux с GT-Aux даёт простой способ определить следующий шаг разработки. Если проверенный чертёж помогает, а автоматически созданный — нет, ресурсы следует направить на планирование построения, точность редактора и повторное чтение изображения. Если готовое построение тоже не улучшает решение, добавление генератора изображений не устраняет основную проблему.

GeoWeave-8B проверяли прежде всего на геометрии, а перенос — на математических и визуально-текстовых наборах задач. Работа не устанавливает, что тот же порядок обучения даст сопоставимый эффект в проектировании, анализе документов или управлении через изображения. Авторы также отмечают высокие вычислительные затраты обучения с подкреплением и пока не обновляют совместно ветви генерации изображения и понимания текста.

Поэтому GeoWeave-8B ещё не служит универсальным основанием для смены модели в продукте. Но GeoVAD-Bench предлагает воспроизводимую схему испытаний: сначала измерить пользу правильного промежуточного состояния, затем автономность его создания и только после этого обучать конкретный сломанный этап.

Источники

Иллюстрация: рисунок из статьи «Beyond Generation and Accuracy: Diagnosing and Enhancing Visual Chain-of-Thought for Geometry Problem Solving», Zhitong Dong, Jicai Pan, Yingguo Gao и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу