Журнал · Rit.work

AIM распределяет бюджет автономных экспериментов между идеями

AIM хранит исследовательские идеи как отдельные ветки, проверяет их реализацию и перераспределяет вычислительный бюджет по результатам экспериментов.

Rit.work
Студия разработки
1 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Автономный агент AIM ведёт несколько исследовательских направлений одновременно и сам решает, на какие эксперименты потратить остаток бюджета. В препринте Google Cloud AI Research и University of Wisconsin-Madison, который не рецензирован и содержит числа, полученные самими авторами, AIM достиг уровня лучшей базовой системы до 3,1 раза быстрее по фактическому времени. Для команд, которые автоматизируют подбор алгоритмов и оптимизацию кода, работа предлагает отдельный контур управления идеями поверх существующих агентов.

Единицей поиска становится идея, а не файл с кодом

Большинство исследовательских агентов меняет исполняемое решение: правит код, запускает проверку и использует результат для следующей версии. Такой поиск хорошо подходит для локальной оптимизации, но смешивает две задачи — выбор перспективного подхода и качество его реализации.

AIM хранит идею отдельно от кода. Идея описывает гипотезу и план эксперимента, после чего независимый агент реализует её, запускает проверку и возвращает результат. Благодаря этому система может сравнивать не только варианты одной программы, но и разные направления решения задачи.

Накопленные идеи AIM каждый раз заново объединяет в группы по смыслу. В одной группе могут оказаться предложения из разных веток генерации, если они используют близкий подход. Оценённые идеи и результаты экспериментов служат ориентирами для ещё не проверенных кандидатов.

Затем система ранжирует группы и отдельные идеи внутри них. Она не пытается предсказать точный результат эксперимента, а задаёт порядок перспективности с учётом прошлых результатов, нехватки данных, новизны и ошибок реализации.

Бюджет движется между исследованием и доработкой

Перед очередным циклом AIM выбирает, где продолжить успешную ветку, а где проверить малоизученное направление. Сначала система определяет режим для каждой параллельной ветки, затем выбирает конкретную идею и передаёт её агенту, который пишет и запускает код.

После эксперимента контур расширяет набор кандидатов четырьмя способами: дорабатывает удачную идею, объединяет совместимые находки, исправляет решение по обратной связи или создаёт новое направление. Из запусков также извлекаются практические уроки о работающих приёмах, узких местах, ошибках сборки и сбоях проверки.

Отдельный аудитор проверяет, действительно ли код реализует выбранную идею и не обходит ли правила оценки. Некорректные решения отбрасываются. Если код оказался рабочим, но реализовал другой подход, система переписывает описание идеи и связывает результат с тем, что было выполнено фактически.

Планировщик управляет шириной поиска. Большое число параллельных веток позволяет проверить больше подходов за один цикл, но задерживает обновление общей картины. Меньшее число веток даёт системе чаще учитывать новые результаты и менять направление. AIM выбирает режим с учётом оставшегося бюджета, а не использует фиксированное число параллельных запусков.

Систему проверяли на 10 задачах AutoLab по системной оптимизации, разработке моделей и CUDA. Каждый вариант запускали трижды в общей среде с одинаковой основной моделью; главным соперником выступал ScientistOne. AIM обошёл его на 1,6 процентного пункта в системных задачах и на 4,9 пункта в более длинных задачах разработки моделей и CUDA.

Менять архитектуру агента стоит не для каждой задачи

AIM полезен там, где существует много правдоподобных направлений, а удачными оказываются немногие. В таких условиях явный список идей помогает контролировать ширину поиска и не расходовать весь бюджет на раннюю доработку первого приемлемого решения.

Это видно на примерах из работы. Для Flash Attention агенты, которые искали на уровне идей, охватили более разнообразные алгоритмические направления. В Radix Sort основной алгоритм в значительной степени задан заранее, поэтому преимущество широкого поиска сократилось: результат сильнее зависел от низкоуровневой доработки кода.

Практический вывод — не заменять контур оптимизации кода менеджером идей, а ставить его уровнем выше. AIM использует именно гибридную схему: верхний уровень распределяет эксперименты между направлениями, а исполнитель внутри каждой ветки итеративно улучшает реализацию по результатам запусков.

Команде понадобится хранить идеи, код, оценки и проверенные уроки как разные сущности. Также потребуется аудит соответствия между замыслом и реализацией: без него высокий результат ошибочно усилит не ту ветку и исказит последующее распределение бюджета.

Пока вывод относится к задачам AutoLab с фиксированными проверяющими программами и изолированным исполнением. Работа поддерживает архитектурное решение для автоматизированной оптимизации моделей и системного кода, но не показывает, как такой контур поведёт себя в исследованиях без однозначной машинной оценки результата.

Источники

Иллюстрация: рисунок из статьи «AIM: Agentic Idea Management for Automated Research», Hyeong Kyu Choi, Bhavana Dalvi Mishra, Jiefeng Chen и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу