Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Повторный проход по обучающим данным может портить рекомендательную модель, потому что она находит целевые ответы в уже обновлённых эмбеддингах. Работа Meta предлагает штрафовать такую зависимость: UWSR превзошёл однопроходное обучение по двум метрикам на всех проверенных наборах. Поскольку препринт не рецензирован и все числа получили сами авторы, метод пока стоит рассматривать как гипотезу для собственного эксперимента, а не готовую замену текущему обучению.
Второй проход меняет смысл обучающих данных
Рекомендательные модели хранят идентификаторы пользователей, товаров и других категорий в таблицах эмбеддингов. Каждая строка такой таблицы — обучаемый вектор, а общая предсказывающая сеть объединяет выбранные строки и вычисляет вероятность клика или другого действия.
При первом проходе модель сначала делает прогноз и только затем обновляет активные строки с учётом правильного ответа. Это соответствует последовательному принципу обучения: ответ не должен влиять на признаки, по которым его предсказывают.
При повторном проходе порядок причин и следствий нарушается. Строка эмбеддинга уже содержит сдвиг, который оставил тот же пример во время предыдущего обновления. Общая сеть может научиться распознавать этот след: ошибка на обучении снижается, но на новом примере такого следа нет.
Авторы называют это асимметрией самовлияния. Она сильнее для редких строк. Если товар встречался мало раз, его эмбеддинг определён хуже, а вклад отдельного ответа в состояние строки заметнее. Простая модель из работы показывает: повторное обучение поощряет сеть полностью доверять такому эмбеддингу, хотя для нового ответа его вклад следовало бы ослабить.
Причину дополнительно проверили вмешательством в порядок обновлений. Когда эмбеддинг успевал получить информацию об ответе до обновления общей сети уже на исходном проходе, чувствительность сети к этим строкам росла. Значит, сбой связан не только с тем, что модель дольше обучается: достаточно позволить текущему ответу попасть в признаки собственного прогноза.
UWSR штрафует зависимость, но не замораживает эмбеддинги
UWSR добавляет к функции потерь штраф за чувствительность прогноза к неопределённым строкам. Чувствительность показывает, насколько изменится логит — число до преобразования в вероятность, — если немного сдвинуть эмбеддинг. Чем хуже строка определена данными и чем сильнее от неё зависит прогноз, тем больше штраф.
Неопределённость оценивают по накопленной информации о градиентах строки. В основном варианте метод использует статистику, которую уже хранит оптимизатор Adam, а после исходного прохода фиксирует её. Чувствительность вычисляют вторичным обратным проходом через модель.
Штраф действует на общую сеть, а не на значения эмбеддингов. UWSR не обнуляет таблицы, не замораживает редкие строки и не ограничивает их нормы. Он делает дорогой именно попытку предсказывающей сети опереться на ненадёжное направление в строке.
После четырёх эпох тестовая кросс-энтропия оказалась ниже однопроходного результата на 6,78% для Amazon Electronics, на 2,29% для Avazu и на 1,38% для MovieLens-20M. Меньшая кросс-энтропия означает более точные вероятности. AUC, то есть способность ранжировать положительные примеры выше отрицательных, также выросла на всех наборах; результаты усреднили по пяти запускам.
В основном протоколе UWSR обошёл обычный повторный проход, MEDA, AdamAR, прореживание эмбеддингов и вариант с их временной заморозкой. Обычный повторный проход при этом показывал характерный разрыв: ошибка на обучении продолжала падать, а проверочная ошибка росла после границы эпохи.
Когда работа меняет план обучения
Работа касается моделей с большими разреженными таблицами и общей плотной сетью поверх них. Если система обучается за один проход только потому, что повторные эпохи ухудшают проверочную метрику, UWSR даёт ещё один вариант наряду с остановкой, сбросом таблиц и ослаблением редких строк.
Практический признак совпадения проблемы — резкое расхождение метрик на границе эпохи при продолжающемся снижении обучающей ошибки. В таком случае полезно отдельно измерить чувствительность логита к редким строкам и сравнить UWSR с текущей однопроходной точкой при одинаковом разбиении данных.
Метод меняет требования к обучающему контуру. Нужна поддержка производных второго порядка, хранение статистики по строкам и отдельная настройка силы штрафа. Выигрыш от дополнительных проходов придётся сопоставить с временем шага и памятью на реальной таблице, а не только с итоговой метрикой.
Основные опыты охватывают MovieLens-20M, Amazon Electronics и Avazu с компактной архитектурой на основе WuKong. Теоретический анализ рассматривает строки независимо и фиксированное повторное обучение, поэтому он не описывает взаимодействия между строками и обновление неопределённости в непрерывном потоке. Для промышленной системы это оставляет один разумный следующий шаг: воспроизвести характерный сбой на собственных данных и только затем проверять штраф.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



