Журнал · Rit.work

Метаобучение промпта не улучшило персонализацию Qwen3

Авторы Muse обнаружили, что оптимизация общего промпта не переносит персонализацию между пользователями и уступает обычному подбору примеров в задаче оценивания.

Rit.work
Студия разработки
3 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Liam Byrne, David Dylan, Orla Fitzgerald и соавторы проверили, переносит ли метаобучение общего промпта персонализацию LLM между пользователями; работа опубликована как препринт, не проходивший рецензирования. На задаче оценивания средняя абсолютная ошибка Muse оказалась на 0,175 выше, чем у обычного подбора примеров из истории пользователя. Результат важен командам, которые рассматривают автоматическую оптимизацию промптов как замену хранению и поиску пользовательских примеров.

Что сделали

Авторы разработали Muse: система оптимизирует один текстовый промпт на истории группы пользователей, а затем фиксирует его и без дополнительного обучения применяет к новым пользователям. Промпт управляет построением текстового описания предпочтений, которое передаётся в Qwen3-30B-A3B с неизменяемыми весами.

Метод проверили на LaMP-2 для категоризации и LaMP-3 для прогнозирования оценок. Чтобы отделить перенос персонализации от улучшения формулировок, авторы сравнили Muse с исходным промптом и контрольным вариантом, обученным на намеренно перепутанных соответствиях между пользователями и их историями.

По замерам авторов, Muse не дал статистически значимого преимущества ни перед исходным промптом, ни перед вариантом с перепутанными историями. Они называют механизм «схлопыванием метацели»: критерий отбора почти одинаково оценивает правильные и нарушенные соответствия, поэтому оптимизация вознаграждает оформление инструкции и подгонку под проверочную группу, а не перенос пользовательских особенностей.

Что это значит

Работа не показывает, что персонализация LLM без изменения весов бесполезна. Она показывает более узкую проблему: улучшение общего промпта по усреднённой метрике нельзя считать обученной адаптацией, пока метод не превосходит исходную инструкцию и не реагирует на подмену пользовательской истории. Для продуктового испытания полезны те же проверки: исходный промпт, перепутанные данные и прямое сравнение с подбором релевантных примеров.

Ограничения. Авторы использовали одну модель, две задачи LaMP и по 200 отложенных пользователей на каждой; промпт выбирался на группе из 30 пользователей. Работа не проверяет генерацию, диалоговые предпочтения и производственные данные. Сравнение также не охватывает другие семейства моделей, мягкие промпты и метаобучение с изменением параметров, поэтому отрицательный результат относится к текстовым промптам, оптимизированным методом Gepa в описанной схеме.

Источники

Иллюстрация: рисунок из статьи «Prompt-Space Meta-Learning Does Not Transfer Across Users: A Frozen-LLM Negative Result», Liam Byrne, David Dylan, Orla Fitzgerald и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу