Журнал · Rit.work

MIMESIS превращает реалистичного пользователя в среду обучения ИИ-агентов

MIMESIS воспроизводит неоднозначное и непоследовательное поведение людей, а его скрытые реакции помогают обучать агентов точнее одной итоговой награды.

Rit.work
Студия разработки
8 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Пользовательский симулятор MIMESIS научили вести диалог менее услужливо и предсказуемо, чем универсальные LLM. В препринте, который не прошёл рецензирование и приводит замеры самих авторов, версия на 9 млрд параметров опередила Claude-Opus-5 на 13,4 пункта по сходству с человеческим поведением в RealUserSim. Такой симулятор можно использовать вместо дорогого потока диалогов с людьми при обучении интерактивных агентов.

MIMESIS построили на Qwen3.5 и обучали продолжать разговор со стороны пользователя. В данные добавили ThoughtTrace: реальные пользователи описывали, почему отправили сообщение и как восприняли предыдущий ответ. Модель училась сначала формировать скрытое рассуждение, а затем публичную реплику.

Из этих разговоров выделили 13 моделей поведения: пользователь может раскрывать сведения не сразу, раздражаться, повторяться или не исправлять ошибку агента. Затем единый симулятор дообучили с подкреплением сразу на разных задачах, поощряя уместное проявление таких особенностей без потери естественности и связи с исходной целью. MIMESIS-9B обошёл сравниваемые универсальные модели на четырёх наборах тестов; в SimulatorArena его диалоги было на 3,6 пункта труднее отличить от человеческих, чем диалоги Claude-Opus-5.

После этого симулятор заморозили и превратили в среду для обучения агента Qwen3-8B. Дополнительный метод CSD использует скрытую реакцию MIMESIS и следующую реплику пользователя: отдельная модель превращает их в короткий совет, а модель-учитель оценивает уже выданный ответ по отдельным токенам. При работе готовый агент видит только обычную историю диалога, без скрытых рассуждений и советов.

Обучение проверяли в восьми средах, а перенос — с девятью симуляторами пользователей, которых агент не встречал во время обучения. Агент, тренировавшийся с MIMESIS, во всех девяти случаях оказался лучше версии, обученной с GPT-5.5; CSD также улучшил результат с каждым из них. Эти выводы относятся к указанным моделям, средам и короткому циклу из 100 шагов оптимизации.

Источники

Иллюстрация: рисунок из статьи «MIMESIS: Learning User Simulators as Training Environments for Interactive Agents», Hoang Phan, Dat Huynh, Andrey Zhmoginov и др., CC0 1.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу