Журнал · Rit.work

Vis-MCTS уточняет неоднозначный запрос до построения графика

VisInteract превращает генерацию графиков по тексту в диалог с поиском альтернатив, общей памятью и отдельной оценкой данных, дизайна и замысла.

Rit.work
Студия разработки
15 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Систему генерации визуализаций научили уточнять неполный или ошибочный запрос, сравнивать несколько трактовок и возвращаться к более удачной. В препринте команды The Hong Kong Polytechnic University и ByteDance, который не прошёл рецензирование и приводит замеры самих авторов, Vis-MCTS улучшил полный успех задачи на 13,40–16,27% относительно сильнейшего интерактивного подхода. Для продуктовой архитектуры это означает переход от цепочки «запрос — график» к управляемому диалогу с общей памятью и проверкой результата.

Как система восстанавливает замысел пользователя

Обычная генерация визуализаций по тексту предполагает, что пользователь сразу сформулировал все условия. Но запрос «покажи выручку пяти лучших продуктов по регионам» не определяет, как выбирать продукты, учитывать ли возвраты и за какой период брать данные. Однопроходная система выбирает трактовку молча и может построить технически исправный, но бесполезный график.

VisInteract описывает задачу иначе: система видит запрос и базу данных, а требования пользователя остаются скрытыми. Она может выполнить SQL-запрос, написать код для Altair, задать текстовый вопрос или завершить работу. После построения графика отдельный канал обратной связи указывает на самое заметное визуальное расхождение.

Vis-MCTS организует эти действия как поиск по дереву методом Монте-Карло. Каждая ветвь хранит последовательность запросов к инструментам, уточнений и вариантов визуализации. Если ранняя гипотеза оказалась неверной, система может продолжить другую ветвь, а не исправлять единственную цепочку поверх накопившихся ошибок.

Открытое пространство действий нельзя перебрать целиком: модель способна написать сколько угодно вариантов SQL, кода или вопросов. Поэтому постепенное расширение ограничивает число дочерних ветвей и добавляет новые по мере повторных посещений узла. Поиск сначала проверяет несколько вариантов, затем расширяет те места, где дополнительная альтернатива может изменить результат.

Уточнения и критика сохраняются в общей памяти всех ветвей. Ответ о нужной агрегации, полученный в одной попытке, больше не приходится запрашивать в другой. Это отличает метод от независимых прогонов агента, которые повторяют вопросы и не используют уже полученную информацию.

Пользовательскую оценку также не распространяют одинаково на всю цепочку. Vis-MCTS разделяет её между точностью данных, визуальным оформлением и соответствием исходному замыслу. Ошибка в подписях не штрафует правильный SQL так же, как неверный фильтр.

Обратная связь дала больший выигрыш, чем ещё одна генерация

На VisInteract-Bench метод обошёл сильнейший интерактивный вариант на 13,40–16,27% по доле задач, где код и итоговый график удовлетворили всем требованиям. Относительно систем без взаимодействия результат оказался более чем в пять раз выше. Сравнение проводили с ReAct и многоагентными схемами, поэтому выигрыш относится не только к простому однопроходному построению.

Разбор компонентов показывает, откуда взялась разница. Без визуальной обратной связи полный успех снизился на 27,22 процентного пункта: поиск лишился итоговой оценки и стал выбирать ветви почти вслепую. Отключение общей памяти между попытками отняло 17,40 пункта, поскольку полезные уточнения перестали распространяться по дереву.

Текстовые вопросы решали условия, которые нельзя надёжно восстановить по картинке: фильтры, агрегации и значение неоднозначных полей. Раздельная награда помогала связать замечание с ответственным действием. Вместе эти результаты поддерживают архитектуру, где диалог, проверка графика и поиск альтернатив работают как единый цикл.

Когда закладывать интерактивный поиск в продукт

Работа меняет планы команд, которые строят аналитических помощников поверх корпоративных баз. Если пользователи регулярно задают неполные запросы, одного улучшенного системного промпта недостаточно: архитектуре нужны явное состояние диалога, хранение подтверждённых условий, несколько кандидатов и возможность вернуться к предыдущему решению.

Полное дерево поиска потребуется не каждому продукту. Для отчётов с фиксированными шаблонами достаточно проверить обязательные поля до генерации. Vis-MCTS уместнее там, где допустимы разные визуальные решения, а ошибка в трактовке метрики или фильтра дороже нескольких дополнительных вызовов LLM.

Проверка охватывает 1 098 примеров из 11 баз BIRD Mini-Dev и две базовые LLM. Неоднозначности, пропуски и фактические ошибки в запросах добавляли контролируемо, пользователя имитировала модель, а код и график оценивали другие модели. Такой стенд позволяет сравнить методы в одинаковых условиях, но реальные пользователи могут отвечать менее последовательно.

Поиск по нескольким ветвям требует больше вычислений, чем однопроходная генерация. Поэтому практический следующий шаг — не немедленная замена работающего конвейера, а отдельное испытание на журнале настоящих запросов: определить типовые неоднозначности, цену неправильного графика и допустимое число обращений к моделям. Если основная доля ошибок связана с неверно восстановленным замыслом, интерактивный контур становится архитектурной частью продукта, а не дополнением к интерфейсу.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу