Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
LLM-агента научили одновременно решать задачи и обновлять базу повторно используемых навыков. Команда Qiantang Credit, Ant Group и The Chinese University of Hong Kong получила 98,4% успешных решений на ALFWorld и 84,7% на WebShop; работа пока не прошла рецензирование, и все числа получили сами авторы. UniSkill убирает отдельные прогоны среды для проверки каждой правки, хотя экономию в деньгах или GPU-часах работа не оценивает.
Одна модель выступает в двух ролях: выполняет задачу и предлагает добавить навык, изменить найденный навык либо оставить базу без правок. Исполнитель учится на наградах среды, а редактор навыков — на результатах уже завершённых эпизодов. Это позволяет синхронно менять модель и её внешнюю память.
Чтобы оценить новый навык, UniSkill берёт успешную и неуспешную траектории одной задачи, собранные до обновления модели. Затем система подставляет новый навык вместо прежнего и проверяет, насколько вероятными модель считает записанные действия. Правка получает положительный сигнал, если она увеличивает разрыв между действиями из успешной и неуспешной траекторий.
Отдельная модель-критик отсеивает неподходящие операции и навыки, которые не следуют из исходной траектории. Дополнительный штраф не даёт редактору преждевременно отказаться от добавления, изменения или пропуска правки: без него обучение в экспериментах сводилось к одной операции.
Метод проверяли в текстовой бытовой среде ALFWorld и симуляторе интернет-магазина WebShop. Основные сравнения использовали Qwen2.5-7B-Instruct: на ALFWorld UniSkill опередил GRPO на 20,8 процентного пункта, а GiGPO — на 7,6 пункта. Сигнал остаётся приближённой оценкой: в одной из проверок 15,6% правок с положительной оценкой всё же ухудшили результат при прямом прогоне.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



