Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Системную инструкцию ИИ-агента улучшили по готовым журналам запусков, не обращаясь заново к рабочей среде. В работе Agamdeep Singh и соавторов, которая не прошла рецензирование и где числа получили сами авторы, такой подход поднял средний результат на 16,6 процентного пункта. Если у команды уже накоплены полные журналы работы агента, оптимизацию можно начинать без симулятора, отдельной проверочной выборки и серии дорогих прогонов.
Кодовый агент сначала считает ошибки, а затем читает примеры
Метод называется Coding-Agent Skill Distillation, сокращённо CASD. На вход агент для программирования получает исходную системную инструкцию и статичный корпус траекторий — полных журналов отдельных запусков с сообщениями, вызовами инструментов, ответами среды, итоговой оценкой и служебными данными.
Дальше агент сам пишет и запускает код анализа. Он считает долю успешных задач по категориям, длину траекторий, частоту вызовов инструментов, повторы и выдуманные аргументы. Затем открывает не все журналы подряд, а те эпизоды, на которые указывают отклонения в статистике.
В конце агент записывает найденные правила в файл Markdown, который становится новой системной инструкцией. Дополнительного цикла, где каждый вариант промпта запускают в среде и принимают только после проверки метрики, нет.
Такой порядок помогает находить закономерности, которые трудно заметить по нескольким примерам. В одном корпусе инструмент get_details_by_id вызвали 284 раза, причём 123 вызова точно повторяли предыдущие. В другом случае проблема проявлялась как отсутствие действия: агент ни разу не вызывал платёжный инструмент, хотя без него нельзя было закрыть часть обращений.
Языковой модели трудно надёжно подсчитать такие события, просто прочитав длинный контекст. CASD переносит подсчёт в исполняемый код, а модели оставляет выбор показательных эпизодов и формулировку правил.
Один офлайн-проход оказался сильнее итеративного поиска
Метод проверили на четырёх средах для агентов: ALFWorld, розничных и телекоммуникационных задачах τ2-bench и работе с таблицами в SpreadsheetBench-Verified. При одинаковом доступе к исходному корпусу CASD обошёл GEPA на большинстве сред, а SkillOpt — на каждой.
В среднем CASD прибавил к исходной инструкции 16,6 процентного пункта. GEPA дал 10,9 пункта, а результат SkillOpt оказался ниже обоих методов. Сравнение важно именно при равных данных: поисковые методы не могли компенсировать слабый сигнал дополнительными запусками в среде.
Создание одной инструкции через CASD стоило около 1,60 доллара — более чем в 22 раза дешевле SkillOpt. В эту оценку не входит сбор исходного корпуса: расчёт предполагает, что журналы появились во время предыдущей разработки или эксплуатации агента.
Преимущество объясняется не более сложным алгоритмом отбора промптов, а другим масштабом анализа. GEPA и SkillOpt размышляют над небольшими порциями траекторий и проверяют предложенные изменения новыми запусками. CASD один раз анализирует весь доступный корпус, поэтому лучше видит редкие ошибки, повторные вызовы и систематически пропущенные действия.
Работа меняет порядок оптимизации, но не отменяет проверку
Для продуктовой команды практический вывод состоит не в замене модели или архитектуры агента. Меняется первый шаг: перед перебором промптов стоит выгрузить полные траектории, посчитать ошибки по всему корпусу и составить набор правил офлайн. Итеративный поиск имеет смысл оставлять для финальной доводки, когда симулятор, надёжная метрика и дополнительные запуски доступны по приемлемой цене.
Чтобы этот подход работал, журнал должен сохранять не только последний ответ модели. Нужны вызовы инструментов и их аргументы, ответы среды, причина завершения задачи и итоговая оценка. Без этих полей кодовый агент увидит текст диалога, но не сможет связать ошибку с конкретным действием или его отсутствием.
Проверка охватывает одну связку моделей: целевым агентом служил GPT-5.4-mini с отключённым рассуждением, а инструкции составлял Claude Sonnet 5 через Claude Code. Неизвестно, сохранится ли преимущество с менее способным анализатором, другими целевыми моделями и журналами иной структуры.
CASD также наследует границы корпуса. Если в журналах нет нужного типа задачи или полезных неудач, анализ не выведет правило для нового сценария. В экспериментах использовали небольшие статичные наборы из перечисленных сред, а результаты CASD и конкурентов оценивали немного разными способами: для CASD сравнивали независимо созданные инструкции, для базовых методов — повторные запуски одной инструкции.
Поэтому работа даёт основание поменять последовательность действий, а не отказаться от контрольной выборки перед выпуском. Сначала дешёвый офлайн-анализ уже собранных траекторий, затем проверка новой инструкции на отложенных задачах и только после этого — поиск с дополнительными запусками, если оставшийся прирост оправдывает расходы.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



