Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Liam Byrne, David Dylan, Orla Fitzgerald и соавторы проверили, переносит ли метаобучение общего промпта персонализацию LLM между пользователями; работа опубликована как препринт, не проходивший рецензирования. На задаче оценивания средняя абсолютная ошибка Muse оказалась на 0,175 выше, чем у обычного подбора примеров из истории пользователя. Результат важен командам, которые рассматривают автоматическую оптимизацию промптов как замену хранению и поиску пользовательских примеров.
Что сделали
Авторы разработали Muse: система оптимизирует один текстовый промпт на истории группы пользователей, а затем фиксирует его и без дополнительного обучения применяет к новым пользователям. Промпт управляет построением текстового описания предпочтений, которое передаётся в Qwen3-30B-A3B с неизменяемыми весами.
Метод проверили на LaMP-2 для категоризации и LaMP-3 для прогнозирования оценок. Чтобы отделить перенос персонализации от улучшения формулировок, авторы сравнили Muse с исходным промптом и контрольным вариантом, обученным на намеренно перепутанных соответствиях между пользователями и их историями.
По замерам авторов, Muse не дал статистически значимого преимущества ни перед исходным промптом, ни перед вариантом с перепутанными историями. Они называют механизм «схлопыванием метацели»: критерий отбора почти одинаково оценивает правильные и нарушенные соответствия, поэтому оптимизация вознаграждает оформление инструкции и подгонку под проверочную группу, а не перенос пользовательских особенностей.
Что это значит
Работа не показывает, что персонализация LLM без изменения весов бесполезна. Она показывает более узкую проблему: улучшение общего промпта по усреднённой метрике нельзя считать обученной адаптацией, пока метод не превосходит исходную инструкцию и не реагирует на подмену пользовательской истории. Для продуктового испытания полезны те же проверки: исходный промпт, перепутанные данные и прямое сравнение с подбором релевантных примеров.
Ограничения. Авторы использовали одну модель, две задачи LaMP и по 200 отложенных пользователей на каждой; промпт выбирался на группе из 30 пользователей. Работа не проверяет генерацию, диалоговые предпочтения и производственные данные. Сравнение также не охватывает другие семейства моделей, мягкие промпты и метаобучение с изменением параметров, поэтому отрицательный результат относится к текстовым промптам, оптимизированным методом Gepa в описанной схеме.
Источники
Иллюстрация: рисунок из статьи «Prompt-Space Meta-Learning Does Not Transfer Across Users: A Frozen-LLM Negative Result», Liam Byrne, David Dylan, Orla Fitzgerald и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



