Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Yifan Zhu, Sammie Katt и Samuel Kaski формализовали планирование предложений с учётом того, насколько пользователю легко их оценить, в препринте, который не проходил рецензирования. В контролируемой симуляции их планировщик ProSE-Plan чаще доводил задачу до успешного результата, чем планировщики без обучения на реакции пользователя. Работа важна командам, которые строят ассистентов для проверки и принятия изменений в коде, текстах, проектах или планах.
Что сделали
Авторы рассматривают ассистента, который не меняет результат самостоятельно, а предлагает пользователю следующий вариант. Пользователь принимает или отклоняет его, после чего ассистент формирует новое предложение. Проблема в том, что реакция зависит не только от полезности варианта: крупное изменение может быть выгодным, но слишком трудным для проверки.
Для описания этого процесса авторы ввели ProSE — последовательную модель помощи со скрытыми параметрами пользователя. Одна группа параметров описывает предпочтения, другая — затраты на оценку предложения. Принятие определяется соотношением между приростом ценности и штрафом за расстояние от текущего состояния.
Расстояние здесь означает масштаб изменения в пространстве задачи, а не обязательно число строк или действий. Например, переход между удалёнными узлами графа моделирует предложение, которое сильнее отличается от текущего состояния. Чем больше расстояние, тем больший выигрыш должен видеть пользователь, чтобы согласиться на изменение.
Каждое предложение играет две роли. Оно может непосредственно улучшить результат и одновременно служит проверкой скрытых параметров пользователя. После принятия или отказа ассистент обновляет распределение вероятностей этих параметров и учитывает его при следующем выборе.
На этой основе авторы построили ProSE-Plan — байесовский планировщик с просмотром на два шага вперёд. Он оценивает не только ближайший результат, но и то, как возможная реакция изменит знания о пользователе и выбор следующего предложения. Метод проверили в двух синтетических задачах на графах: разветвлённом коридоре и сценарии «проверить, затем выбрать».
Что показали
Внутри математической модели авторы разделяют границу принятия и границу информативности. Первая показывает, при каком сочетании ценности и сложности предложение скорее примут. Вторая характеризует предложения, реакция на которые лучше раскрывает допустимую для пользователя сложность.
По анализу авторов, наиболее информативное предложение может находиться там, где отказ вероятнее принятия. Причина в том, что слишком близкие изменения почти ничего не говорят о способности пользователя оценивать сложные варианты, а слишком далёкие почти всегда отклоняются. Полезный для обучения сигнал возникает между этими крайностями.
В сценарии «проверить, затем выбрать» ProSE-Plan достиг успешного результата в 81,5% эпизодов. Персонализированный планировщик, оптимизировавший ближайшее действие, получил 55,0%, а планировщик с тем же горизонтом, но без обновления представлений после предполагаемой реакции, — 55,5%. Авторы оценивают преимущество механизма обучения на реакции в 26 процентных пунктов.
Различие проявилось и в поведении. ProSE-Plan сначала предлагал диагностический промежуточный вариант, а затем выбирал целевую ветвь с учётом принятия или отказа. Базовые методы сразу переходили к привлекательной цели. В разветвлённом коридоре предложенный метод также чаще использовал проверяемые промежуточные состояния вместо далёких переходов, когда оценка изменений была основным ограничением.
Ограничения
Работа не показывает, как ProSE-Plan ведёт себя с реальными пользователями, кодовыми базами, документами или интерфейсами ассистентов. Проверка ограничена двумя синтетическими графовыми задачами и сериями по 200 случайных запусков; реакции создавались заданной авторами моделью принятия и отказа.
В основной реализации ответ пользователя бинарный, а сложность оценки задаётся функцией расстояния. Авторы отдельно отмечают, что для кода она может зависеть от структуры зависимостей и локальности изменений, поэтому графовое расстояние нельзя прямо переносить в продуктовую метрику.
ProSE-Plan использует точный расчёт по сетке параметров и короткий горизонт планирования. В работе нет экспериментального сравнения с производственными ассистентами, приближённым байесовским выводом или планированием в открытом пространстве предложений. Также не измерялись доверие пользователя и последствия намеренно диагностических предложений, которые ассистент ожидает скорее отклонить.
Что это значит
Работа не меняет планы выбора LLM: авторы не сравнивали модели генерации и не оценивали качество созданного ими кода или текста. Она касается слоя взаимодействия поверх модели — выбора того, какое из доступных изменений показать сейчас и как использовать реакцию при следующем шаге.
Для уже разрабатываемого ассистента разумный вывод состоит не в немедленном внедрении ProSE-Plan, а в отделении ценности предложения от его проверяемости. Архитектуре может понадобиться представление масштаба изменения, журнал принятия и отказов, обновляемая модель ограничений пользователя и возможность разбивать крупное изменение на промежуточные варианты.
Меняется и критерий оценки продукта. Доля принятых предложений сама по себе может поощрять мелкие и безопасные изменения, которые не ведут к лучшему итоговому результату. Предложенная авторами постановка требует оценивать всю последовательность: чему ассистент научился из реакции и помогло ли это выбрать более подходящее следующее действие.
Однако намеренно показывать предложения ради получения отказа на основании этих симуляций преждевременно. Практическая проверка должна установить, можно ли получать тот же сигнал без лишней нагрузки и потери доверия. Пока работа даёт формальную гипотезу и ориентир для экспериментов, а не готовый планировщик для производственной системы.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



