Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
LLM-агентов научили чаще обращаться к внешним инструкциям и переносить это поведение на незнакомые пакеты навыков. В препринте MBZUAI, который не прошёл рецензирование и содержит замеры самих авторов, частота чтения нужного навыка выросла с 28% до 96%. Для команд это превращает набор внутренних регламентов и утилит в потенциальный источник учебных задач, а не только в подсказки во время запуска.
Как SkillGym строит задачу вокруг внешнего навыка
Навык здесь — это отдельный пакет с инструкцией, предметными знаниями и иногда исполняемыми утилитами. Модель получает его во время работы: она должна понять содержание, выбрать подходящий способ применения и выполнить действия в среде.
SkillGym начинает с общедоступных пакетов и оставляет те, которые можно воспроизводимо запускать в изолированном контейнере. Подходящий навык не требует сети, GPU или интерактивного ввода, содержит необходимые файлы и не меняет данные за пределами рабочей папки. Такой отбор нужен, чтобы один и тот же результат можно было повторить при сборе данных и проверке модели.
Вокруг навыка строят задачу одного из четырёх типов. Агент либо выполняет зависимую последовательность действий, либо ищет скрытую причину поломки, либо подбирает результат под несколько измеримых условий, либо определяет порядок шагов с зависимостями между ветками.
Каждый пакет задачи содержит инструкцию, исходное состояние рабочей папки, эталонное решение и исполняемый проверяющий модуль. Существенный шаг зависит от знания внутри навыка, но условие не подсказывает его напрямую. При этом задачу можно решить исследованием среды, поэтому навык даёт преимущество, а не служит искусственным пропуском.
Модель-сборщик сначала готовит контейнер и зависимости, а модель-рецензент независимо запускает команды и возвращает замечания. Затем тот же цикл проверяет саму задачу: исходное состояние должно провалить проверку, эталонное решение — пройти её, а проверяющий модуль должен принимать альтернативные корректные решения и отклонять поверхностно похожие результаты.
Так получились 6,8 тысячи сред и 19 тысяч подтверждённых успешных траекторий. Траектория хранит наблюдения агента, его команды и ответы среды. Их собирали с разными моделями-наставниками и агентскими оболочками, чтобы дообучение не привязалось к одному формату инструментов или системной инструкции.
Обучение меняет привычку обращаться к инструкции
После дообучения модели нескольких семейств улучшили результаты на SkillGym, SkillEval, SkillsBench и Skill-Use-Bench. Qwen3.5-9B обошла вариант Qwen3.5 с 397 млрд параметров без такого обучения на тесте SkillGym и в SkillEval. Размер модели в этих условиях оказался менее важен, чем опыт работы с внешними пакетами.
Улучшение переносилось на навыки, которых не было в учебном наборе. Оно также сохранялось для разных способов рассуждения, включая типы задач, которые редко встречались при обучении. Это указывает на усвоение общей последовательности: обнаружить подходящую инструкцию, прочитать её и встроить в план действий.
Рецензирование задач оказалось не формальностью. При одинаковом объёме учебных данных примеры, прошедшие смысловую проверку, улучшали все измеряемые показатели сильнее, чем задачи, где проверили только запуск эталонного решения. Исполняемый тест подтверждает результат, но сам по себе не ловит утечку ответа, двусмысленное условие или слишком узкую проверку.
Разнообразие структуры дало более широкий охват, но не повысило средний результат по сравнению с одними последовательными задачами при равном объёме данных. На этом масштабе качество задачи и проверяющего модуля влияло на учебный сигнал заметнее, чем формальное разнообразие сценариев.
Когда подход меняет планы агентской команды
SkillGym применим к продуктам, где агент получает внешние регламенты, инструкции для операций или локальные утилиты. Вместо того чтобы встраивать каждый новый навык в веса модели, команда может оставить знания отдельными пакетами и учить модель общей дисциплине их использования. Новый пакет тогда подключается без отдельного цикла дообучения именно на его содержание.
Для собственного конвейера понадобятся воспроизводимая среда, эталонный путь и проверка результата, которая допускает несколько корректных решений. Если успех нельзя определить программно, центральное преимущество SkillGym исчезает: система не сможет автоматически отбирать траектории и отсекать задачи с ложным положительным результатом.
Эксперименты охватывали модели размером от 2 до 122 млрд параметров и перечисленные агентские тесты. Среды запускались локально и строились из англоязычных общедоступных навыков, прошедших строгий технический отбор. Поэтому работа прежде всего подтверждает подход для файловых и терминальных сценариев с проверяемым итогом.
Перенос оказался сильнее там, где навык служит справочной документацией. В SkillsBench обучение почти не улучшило задачи, где требовалось правильно применить предметный метод, воспользоваться поставляемой утилитой или изменить существующую систему. Командам с такими сценариями нужны учебные задачи, которые проверяют не факт чтения инструкции, а корректность каждого существенного действия и итогового состояния.
Практический вывод — начинать не с массового сбора внутренних документов, а с небольшого набора процессов, где можно надёжно воспроизвести среду и написать проверку результата. SkillGym показывает, как затем расширять такой набор автоматически, сохраняя ручной смысловой контроль через модель-рецензент.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



