Журнал · Rit.work

Как агент учится на правках пользователя между задачами

TAHI превращает правки, изменения планов и критерии пользователя в память, навыки, обновления весов и проверяемую рубрику качества.

Rit.work
Студия разработки
4 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Авторы Efficient Test-Time Adaptation through Human-AI Interaction исследовали, может ли агент постепенно перенимать требования конкретного специалиста из совместной работы над последовательностью задач. В препринте, не прошедшем рецензирование, развиваемые из диалога рубрики выявляли на 16,0–22,3% больше ошибок, чем критерии, составленные только моделью или человеком. Работа важна командам, которые строят агентов для подготовки текстов, визуальных материалов и других результатов, качество которых нельзя проверить обычными автоматическими тестами.

Что сделали

Авторы предложили TAHI — адаптацию во время эксплуатации на основе взаимодействия человека и агента. Вместо отдельного сбора обучающего датасета система использует следы обычной совместной работы: текстовые замечания, изменения предложенного плана, прямые правки файлов и исправления критериев проверки.

Экспериментальный агент построен на Qwen3.6-35B. Перед выполнением задачи он составляет план, связывает его шаги с итоговыми файлами и предлагает проверяемые критерии. Пользователь может изменить план или результат непосредственно в интерфейсе, а не объяснять каждую правку сообщением. Для визуального материала перемещение элемента преобразуется в изменение кода, которое затем видит агент.

После завершения задачи собранные сигналы используются двумя способами. Адаптация контекста извлекает память с фактами и предпочтениями пользователя, а также навыки — повторяемые процедуры выполнения работы. Эти записи можно просматривать и исправлять. Адаптация весов преобразует начальную и исправленную версии решения в пару предпочтений и обучает LoRA-адаптер методом прямой оптимизации предпочтений: модель должна чаще выбирать итоговую, одобренную пользователем траекторию.

Отдельный модуль развивает рубрику оценки. Первоначальные критерии создаёт LLM, после чего система дополняет их на основании сообщений, редактирования файлов, изменений плана и решений пользователя о прохождении проверки. Так неявное требование вроде изменения композиции или структуры текста превращается в формулировку, которую можно повторно применять к следующим результатам.

Для измерения адаптации авторы брали первый результат агента в новой задаче, созданный без текущих подсказок человека. Его проверяли по финальной рубрике, сформированной после совместной доработки. Такая схема измеряет, переносит ли агент опыт предыдущих сессий, а не только исправляет текущий файл по замечаниям.

Что показали

По замерам авторов, доля успешного самостоятельного выполнения задач выросла максимум на 12,9% при адаптации контекста и на 20,9% при обновлении весов. Положительный эффект сохранялся и на отложенных заданиях, которых не было в последовательности адаптации. Авторы связывают это с переносом предпочтений и рабочих процедур между задачами одного пользователя.

Развиваемые рубрики находили ошибки, пропущенные критериями, которые LLM генерировала за один проход. Рубрики, написанные людьми отдельно от процесса выполнения, также оказывались менее полными: часть требований проявлялась только при просмотре промежуточного результата и его исправлении.

Персонализация не свелась исключительно к индивидуальному стилю. При проверке критериев других участников адаптированные агенты показывали прирост до 8,8%. По интерпретации авторов, взаимодействие содержит как личные предпочтения, так и профессиональные практики, общие для нескольких пользователей.

Ограничения

Работу проверяли на 30 участниках и 600 заданиях только в двух областях: подготовке текстов и визуальных материалов. Это открытые задачи с неоднозначными критериями качества. Результаты не показывают, будет ли тот же подход работать для программирования, аналитических процессов, поддержки клиентов или действий, где ошибка имеет операционные последствия.

Эксперименты построены вокруг одного базового семейства моделей и специально разработанного интерфейса. В работе нет сопоставления с другими базовыми моделями, производственными системами памяти или готовыми платформами персонализации. Также не сравниваются вычислительная стоимость, задержка и инженерная сложность регулярного обновления весов относительно хранения правил только в контексте.

Оценка опирается на рубрику, которая развивается из того же взаимодействия, по которому адаптируется агент. Это уместно для измерения соответствия конкретному пользователю, но не устанавливает внешнюю объективность результата. Масштаб эксперимента также не отвечает на вопрос, как память, навыки и критерии ведут себя при длительной эксплуатации, противоречивых правках и смене ответственного специалиста.

Что это значит

Работа не даёт оснований менять выбранную базовую модель или сразу добавлять обучение весов в производственную систему. Она меняет планирование слоя персонализации: человеческие правки стоит хранить не только как историю диалога, а как структурированные данные, пригодные для повторного использования и проверки.

Практичная первая версия такого контура может обойтись без дообучения. Система сохраняет предпочтения отдельно от процедур, связывает их с источником и задачей, предлагает критерии при следующем запуске и позволяет специалисту удалить неверное обобщение. Это проще проверять и откатывать, чем изменения весов. Обновление LoRA-адаптеров имеет смысл рассматривать позднее, если контекст разрастается или устойчивое поведение не удаётся выразить правилами.

Наиболее значимый продуктовый вывод касается интерфейса. Если агент получает только сообщения в чате, часть полезного сигнала теряется. Изменение плана, непосредственное редактирование результата и исправление автоматической проверки показывают требования, которые пользователь не сформулировал заранее. Для команд, создающих агентов вокруг открытых творческих и экспертных задач, сбор таких действий стоит включить в архитектуру продукта. Для процессов с однозначными тестами работа скорее дополняет существующую проверку, чем заменяет её.

Источники

Иллюстрация: рисунок из статьи «Efficient Test-Time Adaptation through Human-AI Interaction», Zora Zhiruo Wang, Apurva Gandhi, Rulin Shao и др., CC BY-SA 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу