Журнал · Rit.work

SkillGym превращает инструкции для агентов в учебные среды

SkillGym превращает рабочие инструкции в проверяемые задачи, на которых LLM-агенты учатся выполнять процедуры без повторной загрузки навыка в контекст.

Rit.work
Студия разработки
24 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

LLM-агента можно научить рабочей процедуре так, чтобы он выполнял её без повторной подстановки инструкции в контекст. Команда East China Normal University и Shanghai AI Laboratory показала это на Qwen3.5-35B-A3B: после обучения модель без внешних навыков обошла исходную модель, которой навыки давали при запуске; в препринте, который не прошёл рецензирование, все числа получили сами авторы. Для команд это меняет роль библиотеки навыков: она может стать источником проверяемых учебных задач, а не только частью промышленного контура запросов.

Как инструкция становится исполняемой задачей

Обычный навык для агента описывает порядок действий, ограничения, примеры и доступные инструменты. Сам по себе такой документ нельзя использовать для обучения с проверяемым результатом: в нём нет конкретных входных файлов, состояния среды и однозначного условия успеха.

SkillGym сначала собирает содержание навыка в структурированную карточку. Затем разработанный человеком шаблон категории превращает карточку в задание: задаёт входные данные, файловую структуру, зависимости, интерфейс взаимодействия и требования к результату. Каждое задание запускается в Docker, поэтому агент может читать файлы, выполнять команды и получать обратную связь от среды.

Результат проверяет код, а не другая LLM. Для документа проверка может искать обязательные разделы и нужное имя файла, для программы — запускать тесты, для структурированных данных — сверять схему. Проверяющие программы также ловят прямое копирование ответа, подмену входных файлов и фиктивные результаты.

После технической проверки один и тот же агент выполняет задачу с целевым навыком и без него. Если первая попытка успешна, а вторая нет, среда получает метку зависимости от навыка. Это не доказывает, что процедура необходима любой модели: метка описывает поведение одной контрольной конфигурации. Остальные рабочие задания сохраняют как проверенные среды без подтверждённой зависимости.

Так авторы собрали 2 756 сред в 12 категориях: от разработки и работы с данными до бизнеса и документации. Разделение карточки навыка, шаблона задачи и проверяющей программы позволяет обновлять каждую часть отдельно, а не генерировать весь учебный пример одним запросом.

Проверенные действия обучают лучше текста инструкции

Несколько моделей под управлением Codex и Claude Code проходили подготовленные задания. SkillGym сохранил 8 364 успешные траектории: последовательности команд, ответов среды, промежуточных решений и итоговых файлов. В среднем одна траектория включала 49 вызовов инструментов, поэтому набор учит не отдельным командам, а длинным рабочим процедурам.

На успешных траекториях дополнительно обучили Qwen3.5-35B-A3B. В конфигурации Claude Code модель прибавила 199 пунктов рейтинга Elo на GDPval-AA v2, который оценивает выполнение профессиональных задач. На Terminal-Bench 2.1, где агент работает через терминал, доля успешных решений выросла на 19,10 процентного пункта.

На SkillsBench v1.1 с доступом к навыкам SkillGym-Agent решил 51,47% заданий. Без внешней инструкции он также обошёл исходную модель, которая получала навык при запуске. Значит, обучение перенесло в веса модели хотя бы часть порядка действий, а не только улучшило чтение подсказки.

Работу проверяли на одной базовой модели, в средах Codex и Claude Code и на трёх наборах задач. Категории представлены неравномерно, а сравнения с публичными моделями могли использовать другие настройки запуска. Кроме того, результаты получены после обучения на готовых примерах; обучение с наградой от проверяющей программы авторы оставили для дальнейшей работы.

Что SkillGym меняет в планах агентных команд

Подход полезен там, где агент регулярно повторяет устойчивый процесс: готовит файлы по шаблону, меняет код, обрабатывает данные или настраивает инфраструктуру. Если итог можно проверить программой, накопленные инструкции и журналы успешных запусков превращаются в материал для дополнительного обучения.

Это не повод сразу убирать внешние навыки из промышленной системы. Они остаются удобным способом быстро менять процедуру без нового цикла обучения. SkillGym предлагает следующий этап: сначала описать процесс как внешний навык, затем построить исполняемую задачу, собрать проверенные прохождения и только после этого переносить повторяющееся поведение в модель.

Самая трудоёмкая часть здесь — не генерация текста, а формализация результата. На одну принятую среду уходило в среднем 4,5 часа работы с GPT-5.4. Команде придётся поддерживать зависимости, тестовые данные и проверки против обходных решений так же внимательно, как обычный набор интеграционных тестов.

Планы стоит менять, если стоимость длинных подсказок, поиск подходящего навыка или ошибки при следовании инструкции уже мешают работе агента. Тогда библиотеку процедур разумно проектировать сразу в двух формах: как читаемую инструкцию для запуска и как набор воспроизводимых задач для обучения. Если результат нельзя надёжно проверить кодом, SkillGym не устраняет главный риск — модель может научиться проходить формальную проверку, не выполняя задачу по существу.

Источники

Иллюстрация: рисунок из статьи «SkillGym: Internalizing Human Skills into LLMs for Real-World Problem Solving», Zhilong Ge, Yuting Shao, Yutao Yang и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу