Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Агента научили улучшать собственный код, инструкции и инструменты без оценок на целевых задачах. Команда Seoul National University назвала процедуру SelfSearch: средняя доля решённых задач выросла во всех шести сочетаниях моделей и бенчмарков, хотя препринт не рецензирован, а числа получили сами авторы. Дорогие тестовые прогоны можно вынести из цикла правок и оставить для проверки готовых кандидатов.
Как следы правок становятся учебным материалом
Обычный поиск агентной архитектуры работает через внешний сигнал качества. Система меняет инструкции или инструменты, запускает новую версию на наборе задач, получает результат и решает, какие правки сохранить. Каждый кандидат требует отдельного прогона, поэтому стоимость растёт вместе с числом задач и версий.
SelfSearch не показывает агенту целевые задачи и их результаты во время поиска. Вместо этого следующая версия получает записи предыдущих попыток изменить себя: рассуждения, вызовы инструментов, ответы среды, внесённые правки и результаты локальных проверок.
Такая запись содержит практические проблемы, которые агент встретил при работе с собственным репозиторием. Если длинный журнал трудно просматривать, агент может добавить поиск по тексту. Если замена кода сломалась из-за неверного совпадения, следующая версия может сначала читать нужный фрагмент, а затем применять точную правку.
Агенту разрешено менять весь репозиторий: инструкции, инструменты, порядок их вызова и организацию кода. Веса модели остаются прежними, а среда исполнения хранится за пределами редактируемой части и продолжает задавать модель, лимиты и правила записи действий.
Поиск шёл параллельными ветками в течение 10 поколений. Одна ветка искала ограничения в способностях агента, другая училась менять подход после неудачных действий. Они обменивались журналами, но сохраняли разные реализации, поэтому удачная находка могла перейти между ветками без внешней оценки.
Что дал поиск без сигнала качества
Максимальный прирост отдельного агента составил 11,2 процентного пункта на Terminal-Bench 2.1. На SWE-bench Multilingual агент поднял долю решённых задач на 5 процентных пунктов и при этом тратил на 38,5% меньше средств на задания, которые решали и исходная, и изменённая версии.
В сравнении с поиском, который после правок запускал небольшой набор задач, SelfSearch показал сопоставимую долю успеха. Для конфигурации DeepSeek поиск стоил $4,03 против минимум $7,90 у вариантов с внешней оценкой — почти вдвое меньше. При расширенных лимитах найденная обвязка также сравнялась с Codex в публичном сравнении на Terminal-Bench 2.1.
Проверки механизма подтверждают, что важны обе части процедуры. Когда агент не видел журналы прошлых попыток или когда все правки выполняла неизменная исходная версия, средний результат снижался. Значит, пользу приносит не только накопленный код: меняется и тот, кто выполняет следующую правку.
Часть созданных инструментов пригодилась уже на целевых задачах. Агенты применяли поиск по тексту и просмотр диапазона строк, чтобы находить связанные тесты, изучать вызывающий код и проверять исправления. Другие инструменты помогали только читать журналы самоизменения, то есть улучшали сам процесс поиска, а не решение конечной задачи напрямую.
Когда тестовые прогоны можно отложить
Работа меняет планы команд, которые перебирают инструкции, наборы инструментов и логику вызовов агента. Если после каждого кандидата приходится запускать дорогой набор задач, полные журналы правок можно использовать как промежуточный источник опыта, а оценивать только зафиксированные версии.
Это не отменяет итоговую проверку. SelfSearch разделяет создание кандидатов и их оценку: во время поиска агент не знает, стал ли он лучше на целевой выборке, поэтому готовые версии всё равно нужно сравнивать на задачах продукта. Подход экономит прогоны внутри поиска, но не доказывает качество без тестирования.
Эксперименты охватили 269 задач из SWE-bench Verified, SWE-bench Multilingual и Terminal-Bench 2.1. Поиск проводили с конфигурациями GPT-5.6 Sol и DeepSeek V4 Pro, а задачи выполняли GPT-5.6 Luna и DeepSeek V4 Flash. Изменённые обвязки также переносили между семействами моделей без нового поиска.
Граница результата проходит по агентам для программирования и работы в терминале. Для каждой конфигурации выполнили один поиск, поэтому работа показывает, что получить такой результат возможно, но не устанавливает его повторяемость. Практический первый шаг — сохранять полные следы саморедактирования и отделить изменяемый репозиторий агента от среды, которая контролирует модели, лимиты и журналы.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



