Журнал · Rit.work

Mind2Dialogue учит ассистента понимать то, что пользователь не сказал

Mind2Dialogue превращает смоделированные цели и убеждения пользователя в обучающие ответы, но перенос на рассуждение о людях зависит от базовой модели.

Rit.work
Студия разработки
15 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Языковую модель научили отвечать с учётом неявных целей, убеждений и меняющихся обстоятельств пользователя. В нерецензированном препринте Mind2Dialogue все числа получили сами авторы: у двух из трёх базовых моделей улучшилось не только следование предпочтениям, но и рассуждение об убеждениях и действиях людей. Подход меняет прежде всего подготовку обучающих данных, а при работе ассистента не требует передавать ему скрытое состояние пользователя.

Скрытое состояние стало частью обучающей разметки

Обычный синтетический диалог начинается с профиля пользователя: профессии, интересов, предпочтений и других относительно постоянных свойств. Этого недостаточно для продолжительного общения. Цель пользователя может измениться после ответа ассистента, настроение — повлиять на формулировку запроса, а новое знание — сделать прежнее убеждение неактуальным.

M2D-Sim хранит отдельную структурированную запись о пользователе. В ней есть долгосрочные ценности и ограничения, текущие цели, настроение, нерешённые вопросы, история доверия и краткое содержание разговора. Это не измеренное состояние реального человека, а заданные симулятором переменные, которые обновляются по ходу диалога.

Одно и то же состояние видят два генератора. Первый играет пользователя и на его основе формулирует очередную реплику. Второй, ассистент-учитель Oracle, знает причины этой реплики и создаёт ответ с учётом сведений, которые пользователь мог прямо не назвать.

Затем состояние убирают из обучающего примера. Модель-ученик получает только доступную ей историю разговора и ответ Oracle, после чего проходит обычное дообучение с учителем. На этапе применения схема остаётся такой же: модель видит диалог, но не получает готовую запись о целях, убеждениях или эмоциях собеседника.

В корпус вошли 8 244 примера двух видов. Диалоговые примеры учат формулировать ответ внутри разговора, а вопросы и ответы — извлекать сведения о пользователе и рассуждать на их основе. Поведение симулятора меняли с помощью четырнадцати режимов общения и двух запасных режимов: от поиска информации и просьбы о процедуре до социальной реакции и обсуждения самого разговора.

Персонализация выросла у всех моделей, рассуждение — не у всех

Обучение проверяли на Qwen, Llama и OLMo с семью-восемью миллиардами параметров. PersonaMem-v1, PersonaMem-v2 и PrefEval измеряли, учитывает ли ответ известные предпочтения и обстоятельства пользователя. ToMi и BigToM проверяли, может ли модель определить убеждение человека и предсказать его действие; задания этих наборов в обучающий корпус не включали.

В генерации ответов по предпочтениям прирост составил от 26,6 до 40,9 процентного пункта относительно соответствующих моделей после настройки на инструкции. На остальных показателях персонализации все три основы также улучшили результат.

Перенос на рассуждение о людях оказался зависимым от модели. Qwen прибавил 13 пунктов в задании BigToM на предсказание убеждения, а Llama улучшил все проверенные показатели этого класса. OLMo, напротив, потерял 8,2 пункта в предсказании убеждения и 7 пунктов в предсказании действия, хотя стал лучше персонализировать ответы.

Разделение корпуса объясняет часть эффекта. Диалоги сами по себе лучше всего помогали генерировать персонализированные ответы. Обучение только на вопросах и ответах улучшало выбор готового варианта, но ухудшало генерацию относительно исходной модели. Смесь обоих форматов дала Llama лучший средний результат в заданиях на рассуждение о психическом состоянии.

Планы меняет конвейер обучения, а не схема продукта

Для команды, которая строит долгосрочного ассистента, работа предлагает более точную роль симуляции. Синтетический пользователь нужен не только для создания разнообразных запросов или проверки сценариев. Он может задавать скрытую причину поведения, чтобы модель-учитель формировала ответ с заведомым знанием этой причины.

Такой подход можно добавить перед дообучением модели: описать допустимые состояния в предметной области, правила их изменения и ситуации, где они влияют на полезный ответ. Например, для образовательного ассистента это могут быть текущая цель, освоенные темы, заблуждения и реакция на предыдущую подсказку. В рабочем продукте отдельный модуль с этой записью не обязателен — ученик должен восстановить нужный контекст из доступного разговора.

Результаты также показывают, что одной метрики персонализации недостаточно. Модель может лучше следовать предпочтениям и одновременно хуже определять, во что человек верит и как поступит. Поэтому проверка такого обучения должна отдельно охватывать качество ответа, понимание убеждений и прогноз действий.

Работу проверяли на синтетическом корпусе, трёх семействах моделей и автономных тестах персонализации и рассуждения. Этого достаточно, чтобы испытать схему подготовки данных на ограниченной предметной области, но не чтобы по этим результатам менять архитектуру уже работающего ассистента: показанный эффект относится к дообучению и тестовым заданиям, а не к продолжительному взаимодействию с реальными пользователями.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу