Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Отбор «лучшей» части размеченного набора не дал лучшую модель за то же время, когда стоимость поиска данных включили в общий бюджет. В препринте Shandong University, который не рецензировали и где все числа получили сами авторы, сложные способы не выиграли ни одного бюджетного сравнения, а на ImageNet-1K лучше сработало обучение на всех данных по сокращённому расписанию. Для продуктовой команды это меняет базовый план: сначала стоит сокращать число эпох или случайно выбирать данные, а не внедрять отдельный контур отбора.
Размер подвыборки заменили общим бюджетом времени
Представительная подвыборка должна сокращать расходы так: алгоритм просматривает размеченный набор, выбирает полезные примеры, а новая модель обучается только на них. Обычно такие алгоритмы сравнивают при одинаковом размере подвыборки и не включают время на её составление в стоимость.
Авторы объединили отбор и последующее обучение на одной шкале фактического времени. Метод считался полезным, только если за общий бюджет давал более точную модель, чем случайная подвыборка или обучение на всех данных с меньшим числом эпох.
Сравнение охватило четыре набора изображений — от CIFAR-10 до ImageNet-1K — и 11 способов отбора. В опубликованные материалы вошло более 1500 запусков; основные результаты усредняли по трём запускам с разной случайной инициализацией.
Для каждого метода выбирали наиболее выгодное сочетание доли данных и числа эпох, которое помещалось в заданный бюджет. Это важная деталь: сложные алгоритмы не привязывали к одному заранее выбранному режиму, а разрешали использовать лучший доступный вариант.
Все методы обучали по единому рецепту, в основном на ResNet-18. Время отбора измеряли отдельно на одинаковых RTX 4090, а стоимость обучения оценивали по замерам длительности эпохи. Если для метода не было отдельного аудита времени, его отбор считали бесплатным — это допущение работало в его пользу.
Полный просмотр данных съел ожидаемую экономию
На CIFAR-10 и Tiny ImageNet провели 16 сравнений при разных бюджетах. Ни одно не выиграл сложный алгоритм: лучшими становились случайная выборка с сохранением баланса классов, повторный случайный отбор или обучение на всём наборе.
Причина проявилась уже на самом дешёвом режиме CIFAR-10. Случайная стратегия успевала начать обучение за 63 секунды, тогда как минимальная цена сложного отбора начиналась с 84 секунд. Алгоритм сначала должен обучить вспомогательную модель, извлечь признаки или вычислить оценки для всего набора — и только после этого может отбросить часть примеров.
Уменьшение итоговой подвыборки почти не снижает эту начальную цену. Алгоритму всё равно приходится просматривать полный набор, поэтому именно просмотр, а не обучение на выбранных данных, становится нижней границей расходов. На более крупном датасете абсолютную стоимость нельзя надёжно предсказать по замерам на маленьком.
На ImageNet-1K сравнили стратегии при одинаковом времени. Обучение на всех изображениях с сокращённым числом эпох оказалось одновременно точнее и дешевле проверенных вариантов с предварительным отбором. Иными словами, доступное время выгоднее потратить на обновление основной модели, а не на вычисление того, какие данные ей показать.
Работа также показывает, насколько результаты зависят от реализации. Авторы исправили девять ошибок в распространённой кодовой базе DeepCore; одна из них меняла результат Herding почти на 6 процентных пунктов. Поэтому прежние рейтинги методов, полученные на этой реализации, стоит перепроверять перед инженерным выбором.
Разовый отбор не стоит добавлять в план продукта
Для однократного обучения базовый порядок действий теперь выглядит проще. При жёстком бюджете стоит взять максимально большую случайную подвыборку с сохранением долей классов. Если времени больше, выгоднее обучать модель на полном наборе по сжатому расписанию; повторный случайный отбор подходит там, где конвейер позволяет менять примеры между эпохами.
Сложный отбор сохраняет смысл, когда одну подвыборку используют многократно: для нескольких архитектур, повторных экспериментов или регулярного переобучения. Тогда начальную стоимость можно распределить между запусками. Наиболее устойчиво в этих опытах выглядели методы, которые покрывают пространство признаков, включая Herding, но выигрыш зависел от датасета и выбранной доли данных.
Перед внедрением такого контура нужно сравнить три полных сценария на собственной инфраструктуре: отбор плюс обучение, случайную подвыборку и сокращённое обучение на всех данных. Замерять следует фактическое время от начала отбора до готовой модели, а не только длительность её обучения.
Граница вывода проходит по задаче и протоколу. Работа изучает классификацию изображений, где выбирают постоянную подвыборку, а затем обучают новую модель с нуля; основные опыты используют ResNet-18. Результат нельзя автоматически переносить на активное обучение, дистилляцию датасетов или отбор текстов для предварительного обучения LLM — для них нужны отдельные бюджетные сравнения.
Абсолютная точность в работе несколько оптимистична: для запуска брали лучший результат среди проверок на тестовом наборе, а отдельной валидационной выборки не было. Пересчёт по последней эпохе менял отдельных победителей, но не общий вывод: первое место оставалось за простыми стратегиями.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



