Журнал · Rit.work

ZAPS соединяет быстрые оценки и топологию в поиске архитектур

ZAPS отбирает кандидатов по дешёвым сигналам, структуре вычислительного графа и неопределённости прогноза, сокращая число полных проверок архитектур.

Rit.work
Студия разработки
15 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Перспективные нейросетевые архитектуры можно находить, обучая полностью лишь небольшую часть кандидатов. В работе ENSICAEN, ISIA Lab и Université de Mons алгоритм ZAPS при бюджете в 200 проверок нашёл 52,3% истинной сотни лучших архитектур на CIFAR-10, хотя препринт ещё не рецензирован и числа получили сами авторы. Это даёт командам способ направлять дорогие запуски обучения, а не распределять их случайно или по одной приблизительной оценке.

Как ZAPS объединяет дешёвые сигналы и структуру сети

Быстрая оценка без обучения (zero-cost proxy) вычисляет свойства сети сразу после инициализации, обычно за один прямой или обратный проход. Такие оценки отражают поток градиентов, параметры, активации и другие признаки, но каждая видит лишь часть картины.

Простое усреднение не решает проблему, потому что разные оценки часто повторяют друг друга. Например, flops и params почти одинаково ранжируют кандидатов: их ранговая корреляция равна 0,996. Общая ошибка при таком объединении не компенсируется, а получает больший вес.

Первый компонент ZAPS, ProxyFit, сортирует оценки по связи с итоговой точностью и последовательно отбрасывает те, которые слишком похожи на уже выбранные. Это сокращает набор признаков и оставляет сигналы, которые дополняют друг друга.

Затем алгоритм формирует начальную выборку для полного обучения. Одну её часть он набирает из области, где быстрые оценки обещают хороший результат, а другую распределяет по всему пространству с помощью K-means. Так модель получает перспективные примеры, но сохраняет шанс заметить архитектуры, которые приблизительные оценки занизили.

После первых проверок ZAPS заново выбирает полезные оценки на накопленных данных. Несколько выборок с возвращением стабилизируют решение: в итоговый набор попадают признаки, которые чаще выигрывают голосование по полезности и не дублируют соседей.

Ансамбль XGBoost получает два блока признаков: ранги по выбранным оценкам и двоичный код операций и связей в вычислительном графе. Для каждого неизученного кандидата он прогнозирует точность и оценивает неопределённость по расхождению моделей. Следующая проверка достаётся архитектуре с хорошим прогнозом либо высокой неопределённостью, поэтому поиск чередует использование уже найденной области и разведку новых.

Быстрые оценки дают основной выигрыш

На CIFAR-100 ZAPS нашёл 65,8% истинной сотни лучших кандидатов. При одинаковом бюджете он опередил Random Search, Local Search, REA, BANANAS и TPE не менее чем на 15 процентных пунктов.

На более сложном NAS-Bench-101 метод достиг 31,5%, тогда как ближайший из перенесённых конкурентов, TPE, получил 18,4%. Здесь преимущество росло вместе с бюджетом: пространство оставалось далеко от насыщения, и дешёвые предварительные сигналы продолжали помогать поиску.

Проверка отдельных компонентов показывает, откуда берётся результат. Если оставить топологический код, но убрать быстрые оценки, доля найденных лидеров падает до 31,1%. Значит, структура сети улучшает прогноз, но не заменяет сведения о поведении архитектуры при инициализации.

Эксперименты проходили на NAS-Bench-201 и NAS-Bench-101 с данными CIFAR-10, CIFAR-100 и ImageNet16-120. Это табличные наборы: точность архитектуры извлекали из готовой таблицы, а сети в ходе опытов не обучали. Поэтому работа проверяет качество выбора кандидатов, но не подтверждает экономию времени и GPU в реальном цикле обучения.

Работа меняет экспериментальный план, но не стек

ZAPS подходит для задач, где команда заранее задала дискретное пространство архитектур, может вычислить быстрые оценки для всех кандидатов и умеет представить их структуру фиксированным кодом. Метод не заменяет конструктор пространства и не переносит готовую модель между произвольными типами сетей.

Самая спорная часть — первоначальная настройка ProxyFit по известной точности всего пространства. В новом проекте такого полного набора меток обычно нет. Авторы перенесли набор оценок между датасетами и между NAS-Bench-201 и NAS-Bench-101; расхождение с настройкой непосредственно на целевом пространстве не превышало 4,2 процентного пункта. Это поддерживает идею одноразовой калибровки, но пока только в пределах использованных табличных наборов.

Практический вывод — не переписывать существующий контур NAS, а добавить ZAPS как стратегию распределения бюджета. Если полное обучение кандидата дорого, сравнение с текущим поиском стоит проводить по числу действительно обученных архитектур из верхней области, а не по качеству итогового рейтинга, в котором часть сетей никогда не проверялась.

Работа также показывает, что добавлять все доступные приблизительные метрики опасно. Сначала следует убрать повторяющиеся сигналы, затем объединить оставшиеся со структурой сети и только после этого направлять проверки по прогнозу и его неопределённости.

Источники

Иллюстрация: рисунок из статьи «ZAPS: Zero-Cost Active Proxy Search for Neural Architecture Search», Hassan Touayouch, Rabie Najem, Mohammed Benjelloun, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу