Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Исследователи из Beijing Academy of Artificial Intelligence и трёх университетов представили DisCo — систему, которая снабжает исследовательских агентов предметными навыками; работа опубликована как препринт, не проходивший рецензирования. В лучшем из проведённых сравнений результат того же агента с навыками оказался более чем вдвое выше, чем без них. Работа важна командам, которые автоматизируют эксперименты, воспроизведение научных статей и разработку моделей машинного обучения.
Что сделали
Авторы выделяют в архитектуре агента отдельный слой — операционные знания. Модель умеет рассуждать и писать код, а управляющая обвязка отвечает за планирование, память, запуск инструментов и проверку результатов. Но ни один из этих компонентов сам по себе не объясняет, какую библиотеку выбрать, как настроить обучение, какие ограничения API учитывать и по каким признакам отбраковывать некорректный эксперимент.
DisCo извлекает такие сведения из репозиториев, статей и документации, а затем упаковывает их в навыки. Каждый навык состоит из трёх частей:
SKILL.mdописывает назначение навыка, условия применения, порядок действий и типичные ошибки;references/содержит документацию, параметры и другие материалы, которые загружаются только при необходимости;scripts/предоставляет исполняемые обёртки с заданными входами и выходами.
Такое постепенное раскрытие не требует помещать весь исходный репозиторий в контекст модели. Сначала агент видит краткое описание, а подробности и скрипты открывает только для выбранной ветки задачи.
Система поддерживает два режима подготовки навыков. В независимом от задачи режиме она заранее разбирает конкретный репозиторий или статью и выделяет пригодные для повторного использования возможности. В режиме под задачу агент сначала определяет пробелы в собственных знаниях, затем ищет подходящие материалы и создаёт недостающие инструкции.
Процесс включает определение области навыка, привязку утверждений к исходным материалам, сборку файлов и проверку. Если проверка обнаруживает проблему, навык исправляется, а неустранённые пробелы сохраняются в записи о создании. Полученная библиотека AREX-Skill содержит более 5 000 навыков, организованных так, чтобы агент мог выбирать только относящиеся к запросу элементы.
Что показали
Авторы сравнивали одну и ту же конфигурацию агента с доступом к навыкам и без него. В основе оставалась GPT-5.5, управляющая обвязка не менялась, а бюджет выполнения основной задачи был одинаковым. Поэтому измеренная разница относится именно к добавленному операционному контексту, а не к замене модели или увеличению числа попыток.
- На MLE-bench итоговая оценка выросла на 134,3 %.
- На PaperBench прибавка составила 34,4 %.
- На FrontierCS авторы измерили рост на 9,2 %.
- На PassNet результат увеличился на 14,0 %.
Это относительный рост оценок конкретных бенчмарков, а не доля полностью решённых задач и не прибавка в процентных пунктах. Разброс между наборами также существенен: эффект зависит от того, насколько задаче нужны специализированные процедуры и знания об используемых инструментах.
По интерпретации авторов, навыки сокращают повторное исследование уже известных свойств библиотек и конфигураций. Вместо пробных запусков агент получает готовые критерии выбора, последовательность действий и способы восстановления после типичных ошибок. При этом сама модель не дообучается: знания остаются внешними, проверяемыми и заменяемыми артефактами.
Ограничения
Библиотеку собирали из 1 000 широко используемых ML-репозиториев, а итоговую систему проверяли на перечисленных наборах исследовательских и инженерных задач. Работа не устанавливает, сохранятся ли результаты в других предметных областях, с другими моделями и управляющими обвязками. Она также не показывает, как долго навыки остаются корректными после обновления исходных репозиториев и сколько ресурсов потребует их регулярная пересборка.
Создание навыков завершалось до запуска основной задачи, поэтому одинаковый бюджет выполнения не означает одинаковую полную стоимость системы. Для эксплуатационной оценки понадобилось бы учитывать поиск источников, проверку, исправления и поддержку библиотеки. Основное контролируемое сравнение противопоставляет агента с навыками тому же агенту без них; его недостаточно, чтобы отделить преимущества формата DisCo от обычной загрузки документации, поиска по репозиторию или навыков, подготовленных специалистами вручную.
Что это значит
Для команд, которые уже строят исследовательских агентов, работа меняет скорее архитектурный план, чем выбор базовой модели. Предметные инструкции стоит рассматривать как самостоятельный слой рядом с моделью и управляющей обвязкой, а не как очередной фрагмент общего системного запроса. Такой слой можно версионировать вместе с исходными репозиториями, проверять отдельно и загружать по запросу.
Переносить всю систему на DisCo по результатам одной работы рано. Практический следующий шаг — проверить подход на повторяющихся внутренних задачах, где агент регулярно тратит время на одни и те же API, конфигурации и ошибки запуска. Внутренний эксперимент должен учитывать не только качество результата, но и полную стоимость создания, проверки и обновления навыков.
Если проблема агента связана с незнанием конкретных инструментов, внешний слой операционных знаний может оказаться полезнее замены модели. Если же сбои вызваны планированием, доступом к среде или ненадёжной проверкой результатов, навыки не заменят доработку управляющей обвязки. Работа даёт основание добавить такой слой в проектирование, но не подтверждает его универсальность за пределами исследованной конфигурации.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



