Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Пользовательский симулятор MIMESIS научили вести диалог менее услужливо и предсказуемо, чем универсальные LLM. В препринте, который не прошёл рецензирование и приводит замеры самих авторов, версия на 9 млрд параметров опередила Claude-Opus-5 на 13,4 пункта по сходству с человеческим поведением в RealUserSim. Такой симулятор можно использовать вместо дорогого потока диалогов с людьми при обучении интерактивных агентов.
MIMESIS построили на Qwen3.5 и обучали продолжать разговор со стороны пользователя. В данные добавили ThoughtTrace: реальные пользователи описывали, почему отправили сообщение и как восприняли предыдущий ответ. Модель училась сначала формировать скрытое рассуждение, а затем публичную реплику.
Из этих разговоров выделили 13 моделей поведения: пользователь может раскрывать сведения не сразу, раздражаться, повторяться или не исправлять ошибку агента. Затем единый симулятор дообучили с подкреплением сразу на разных задачах, поощряя уместное проявление таких особенностей без потери естественности и связи с исходной целью. MIMESIS-9B обошёл сравниваемые универсальные модели на четырёх наборах тестов; в SimulatorArena его диалоги было на 3,6 пункта труднее отличить от человеческих, чем диалоги Claude-Opus-5.
После этого симулятор заморозили и превратили в среду для обучения агента Qwen3-8B. Дополнительный метод CSD использует скрытую реакцию MIMESIS и следующую реплику пользователя: отдельная модель превращает их в короткий совет, а модель-учитель оценивает уже выданный ответ по отдельным токенам. При работе готовый агент видит только обычную историю диалога, без скрытых рассуждений и советов.
Обучение проверяли в восьми средах, а перенос — с девятью симуляторами пользователей, которых агент не встречал во время обучения. Агент, тренировавшийся с MIMESIS, во всех девяти случаях оказался лучше версии, обученной с GPT-5.5; CSD также улучшил результат с каждым из них. Эти выводы относятся к указанным моделям, средам и короткому циклу из 100 шагов оптимизации.
Источники
Иллюстрация: рисунок из статьи «MIMESIS: Learning User Simulators as Training Environments for Interactive Agents», Hoang Phan, Dat Huynh, Andrey Zhmoginov и др., CC0 1.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



