Журнал · Rit.work

AgentDiscover отдаёт стратегию поиска самому кодирующему агенту

AgentDiscover заменяет заданный человеком алгоритм поиска на кодирующего агента с графовой памятью, изолированной проверкой решений и перезапуском контекста.

Rit.work
Студия разработки
7 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Кодирующий агент научился сам решать, какие прошлые попытки изучать и как продолжать поиск, вместо работы внутри заранее заданного эволюционного алгоритма. В препринте AgentDiscover с участием исследователей Texas A&M, который пока не прошёл рецензирование и где все числа получили сами авторы, программы системы заняли бы первое место в семи прошлых эвристических конкурсах AtCoder. Для команд это меняет устройство автоматического поиска: модель можно сделать не только генератором решений, но и планировщиком всего эксперимента.

Фиксированный алгоритм больше не выбирает контекст за модель

Фреймворки для автоматического научного поиска обычно разделяют работу между тремя компонентами. Алгоритм выбирает предыдущие решения, LLM предлагает новое, а проверяющая программа выставляет ему оценку. Модель видит только те примеры, которые выбрал алгоритм, и не может сменить стратегию по ходу работы.

Так устроены системы с MAP-Elites, поиском по дереву и островными эволюционными алгоритмами. Их правила различаются, но ключевое решение разработчики принимают заранее: какие результаты вернуть модели и как распределить вычисления между направлениями.

AgentDiscover убирает этот фиксированный слой. Один кодирующий агент изучает историю, выбирает перспективные идеи, пишет и запускает вспомогательные программы, отправляет очередное решение на проверку и решает, что исследовать дальше. Если поиск застрял, агент может отказаться от прежней схемы, а не ждать, пока сработает предусмотренное разработчиком условие.

Проверяющая программа при этом остаётся фиксированной. Она запускает решение отдельно от рабочей среды агента и возвращает числовую оценку. Такое разделение не даёт модели менять критерий, по которому оценивают её работу.

Графовая база заменяет бесконечно растущий контекст

История поиска хранится не в журнале, который приходится каждый раз читать целиком, а в графовой базе данных. В ней связаны идеи, кандидаты, сессии и выводы агента: можно запросить лучшие решения для конкретной идеи, проследить происхождение кандидата или найти направления, которые уже закончились неудачей.

Классическая стратегия при такой схеме превращается в запрос к базе. Например, MAP-Elites сохраняет лучший вариант для каждой смысловой ниши; агент может получить такой набор одним запросом, объединить его с другим способом отбора или вообще выбрать собственное правило. База задаёт структуру памяти, но не диктует стратегию.

Работа идёт отдельными сессиями. Когда контекст становится дорогим или мешает выйти из тупика, текущий агент записывает выводы и завершает работу. Следующий начинает с чистым контекстом, но получает ту же базу, созданные инструменты и накопленные навыки.

Дополнительный мета-агент анализирует журналы завершённых сессий и превращает удачные способы рассуждения в инструкции для следующих запусков. С такой подсказкой новый агент превосходил прежний лучший результат среди первых двух кандидатов в 73% случаев против 33% без неё.

На задаче сборки вычислительного ядра AgentDiscover достиг результата в 960 тактов — лучшего среди сравниваемых фреймворков при одинаковой модели и бюджете. Ещё на одиннадцати задачах математической и системной оптимизации система повторила или превзошла все базовые методы с той же моделью.

Менять стоит архитектуру эксперимента, а не весь продукт

Работа относится к задачам, где решение можно выразить программой и автоматически проверить: разработке вычислительных ядер, биологии, проектированию алгоритмов, математике и системной оптимизации. Она не проверяет открытые исследования, где результат оценивает человек или физический эксперимент.

Основные таблицы опираются на один запуск каждого варианта, поэтому небольшие разрывы между методами нельзя считать устойчивыми. Авторы использовали модели Claude и в части задач GPT-6 Sol, но не сравнивали разные базовые модели на одной фиксированной задаче. Пока результаты показывают работоспособность архитектуры, а не независимость от выбранной LLM.

Для команды, которая строит поиск с машинной проверкой результата, практический вывод состоит из трёх решений. Агенту стоит дать доступ к структурированной истории, проверяющую программу нужно изолировать от его среды, а длинную работу — делить на сессии с общей долговременной памятью. Фиксированный эволюционный алгоритм при этом можно оставить как доступный агенту инструмент, но не как обязательного диспетчера.

Отдельного внимания требует сама проверка. При воспроизведении прежних задач команда обнаружила способы получить высокую оценку без корректного решения и исправила уязвимые проверяющие программы. Если агент сам планирует поиск и пишет код, слабый критерий он будет оптимизировать столь же настойчиво, как правильный.

AgentDiscover не доказывает, что свободное планирование всегда лучше заданного алгоритма. Но работа даёт проверяемую архитектуру для прототипа: агент управляет поиском, графовая база сохраняет историю, а внешний сервер контролирует оценки и бюджет. Такой вариант имеет смысл испытать рядом с текущим поисковым контуром, прежде чем заменять его в рабочей системе.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу