Журнал · Rit.work

Отбор данных проиграл сокращённому обучению на всём наборе

Учёт времени на поиск представительной подвыборки меняет результаты: при разовом обучении случайный отбор и сокращённое обучение на всех данных оказываются выгоднее сложных методов.

Rit.work
Студия разработки
22 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Отбор «лучшей» части размеченного набора не дал лучшую модель за то же время, когда стоимость поиска данных включили в общий бюджет. В препринте Shandong University, который не рецензировали и где все числа получили сами авторы, сложные способы не выиграли ни одного бюджетного сравнения, а на ImageNet-1K лучше сработало обучение на всех данных по сокращённому расписанию. Для продуктовой команды это меняет базовый план: сначала стоит сокращать число эпох или случайно выбирать данные, а не внедрять отдельный контур отбора.

Размер подвыборки заменили общим бюджетом времени

Представительная подвыборка должна сокращать расходы так: алгоритм просматривает размеченный набор, выбирает полезные примеры, а новая модель обучается только на них. Обычно такие алгоритмы сравнивают при одинаковом размере подвыборки и не включают время на её составление в стоимость.

Авторы объединили отбор и последующее обучение на одной шкале фактического времени. Метод считался полезным, только если за общий бюджет давал более точную модель, чем случайная подвыборка или обучение на всех данных с меньшим числом эпох.

Сравнение охватило четыре набора изображений — от CIFAR-10 до ImageNet-1K — и 11 способов отбора. В опубликованные материалы вошло более 1500 запусков; основные результаты усредняли по трём запускам с разной случайной инициализацией.

Для каждого метода выбирали наиболее выгодное сочетание доли данных и числа эпох, которое помещалось в заданный бюджет. Это важная деталь: сложные алгоритмы не привязывали к одному заранее выбранному режиму, а разрешали использовать лучший доступный вариант.

Все методы обучали по единому рецепту, в основном на ResNet-18. Время отбора измеряли отдельно на одинаковых RTX 4090, а стоимость обучения оценивали по замерам длительности эпохи. Если для метода не было отдельного аудита времени, его отбор считали бесплатным — это допущение работало в его пользу.

Полный просмотр данных съел ожидаемую экономию

На CIFAR-10 и Tiny ImageNet провели 16 сравнений при разных бюджетах. Ни одно не выиграл сложный алгоритм: лучшими становились случайная выборка с сохранением баланса классов, повторный случайный отбор или обучение на всём наборе.

Причина проявилась уже на самом дешёвом режиме CIFAR-10. Случайная стратегия успевала начать обучение за 63 секунды, тогда как минимальная цена сложного отбора начиналась с 84 секунд. Алгоритм сначала должен обучить вспомогательную модель, извлечь признаки или вычислить оценки для всего набора — и только после этого может отбросить часть примеров.

Уменьшение итоговой подвыборки почти не снижает эту начальную цену. Алгоритму всё равно приходится просматривать полный набор, поэтому именно просмотр, а не обучение на выбранных данных, становится нижней границей расходов. На более крупном датасете абсолютную стоимость нельзя надёжно предсказать по замерам на маленьком.

На ImageNet-1K сравнили стратегии при одинаковом времени. Обучение на всех изображениях с сокращённым числом эпох оказалось одновременно точнее и дешевле проверенных вариантов с предварительным отбором. Иными словами, доступное время выгоднее потратить на обновление основной модели, а не на вычисление того, какие данные ей показать.

Работа также показывает, насколько результаты зависят от реализации. Авторы исправили девять ошибок в распространённой кодовой базе DeepCore; одна из них меняла результат Herding почти на 6 процентных пунктов. Поэтому прежние рейтинги методов, полученные на этой реализации, стоит перепроверять перед инженерным выбором.

Разовый отбор не стоит добавлять в план продукта

Для однократного обучения базовый порядок действий теперь выглядит проще. При жёстком бюджете стоит взять максимально большую случайную подвыборку с сохранением долей классов. Если времени больше, выгоднее обучать модель на полном наборе по сжатому расписанию; повторный случайный отбор подходит там, где конвейер позволяет менять примеры между эпохами.

Сложный отбор сохраняет смысл, когда одну подвыборку используют многократно: для нескольких архитектур, повторных экспериментов или регулярного переобучения. Тогда начальную стоимость можно распределить между запусками. Наиболее устойчиво в этих опытах выглядели методы, которые покрывают пространство признаков, включая Herding, но выигрыш зависел от датасета и выбранной доли данных.

Перед внедрением такого контура нужно сравнить три полных сценария на собственной инфраструктуре: отбор плюс обучение, случайную подвыборку и сокращённое обучение на всех данных. Замерять следует фактическое время от начала отбора до готовой модели, а не только длительность её обучения.

Граница вывода проходит по задаче и протоколу. Работа изучает классификацию изображений, где выбирают постоянную подвыборку, а затем обучают новую модель с нуля; основные опыты используют ResNet-18. Результат нельзя автоматически переносить на активное обучение, дистилляцию датасетов или отбор текстов для предварительного обучения LLM — для них нужны отдельные бюджетные сравнения.

Абсолютная точность в работе несколько оптимистична: для запуска брали лучший результат среди проверок на тестовом наборе, а отдельной валидационной выборки не было. Пересчёт по последней эпохе менял отдельных победителей, но не общий вывод: первое место оставалось за простыми стратегиями.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу