Журнал · Rit.work

Почему переносимому селектору данных нужна другая функция потерь

TESS обучает селектор на части корпуса, переносит его на новые данные и избегает схлопывания весов, которое возникает у прежней функции потерь.

Rit.work
Студия разработки
2 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Селектор обучающих примеров научили на небольшой части корпуса, а затем применили к новым наборам, полному корпусу и более крупной LLM. В работе NTU, которая пока не прошла рецензирование и приводит замеры самих авторов, TESS обучили на 50 тысячах примеров, применили к корпусу из 197 тысяч и получили для Llama-2-7B преимущество 4,92 пункта над случайным отбором. Это позволяет проверять отбор данных без запуска всей процедуры на полном корпусе.

Почему общая сеть перестаёт различать примеры

Метаобучение для отбора данных связывает вес каждого примера с результатом на целевом проверочном наборе. Примеры, которые помогают снизить ошибку на нём, получают больший вес и сильнее влияют на обучение основной модели.

Методы вроде ScaleBiO назначают отдельный вес каждому примеру. Такой подход различает данные внутри одного набора, но не умеет оценивать новые примеры: у них ещё нет обученных весов. Естественное решение — заменить таблицу весов общей сетью, которая читает пример и выдаёт его оценку.

Проблема возникает в самой функции потерь ScaleBiO. Она нормирует веса по всему набору, поэтому примеры конкурируют: вес растёт, если полезность примера выше текущего взвешенного среднего, и падает в противном случае. Когда лучший пример поднимает среднее, всё больше остальных оказывается ниже порога.

В пределе почти весь вес достаётся одному примеру, а оценки остальных стремятся к нулю. Селектор сначала учится отличать полезные данные от вредных, но при дальнейшем обучении теряет это различие. Ранняя остановка может поймать удачный момент, однако его приходится подбирать отдельно для нового набора.

Вторая причина — предпочтение признаков, которые проще выучить. Если поверхностный признак совпадает с полезностью примеров на обучающем наборе, прежняя функция продолжает его усиливать. После смены набора эта зависимость исчезает, и оценки перестают переноситься.

В управляемом опыте авторы смешали задачи GSM8K с небезопасными примерами и проверили, сможет ли селектор поместить вредные данные в нижнюю часть рейтинга. TESS сохранил точность около 98% как на знакомых, так и на новых данных, тогда как варианты с функцией ScaleBiO после первоначального улучшения опустились примерно до 60%.

TESS превращает полезность примера в обычную целевую метку

TESS разрывает совместное обучение основной модели и селектора. Вместо соревнования нормированных весов метод сначала вычисляет для каждого примера отдельную оценку полезности, а затем обучает сеть предсказывать её как обычное числовое значение.

  1. Первую копию LLM обучают только на исходном обучающем наборе.
  2. Вторую копию обучают на том же наборе, но дополнительно направляют целевой проверочной выборкой.
  3. Для каждого примера сравнивают ошибки двух моделей. Если модель, видевшая целевую выборку, справляется лучше, пример считают более близким к нужной задаче.
  4. Полученную разницу используют как псевдометку для селектора. Его обучают с помощью среднеквадратичной ошибки — эту функцию авторы называют поточечным сопоставлением ценности, или PVM.

После этого обе LLM замораживают, а селектор оценивает примеры из другого набора без дополнительной настройки. Каждая оценка сопоставляется со своей псевдометкой независимо, поэтому лучший пример не подавляет веса остальных.

Последовательная схема также разводит требования к памяти: две LLM и селектор не нужно одновременно держать в режиме обучения. Она не устраняет вычисления — команде всё ещё нужно обучить две версии модели и получить представительную целевую выборку, — но снимает пиковую нагрузку совместной оптимизации.

Работа меняет план эксперимента, но не весь конвейер

Перенос проверяли в трёх направлениях: между наборами данных, с части корпуса на полный набор и с меньшей модели на большую. Опыты охватывают отбор безопасных инструкций на Alpaca и Dolly, а также целевое дообучение Llama-2-7B для GSM8K и Codex. Для переноса между масштабами использовали Qwen2.5-0.5B-Instruct и Qwen2.5-7B-Instruct.

При обучении селектора на меньшей Qwen время сократилось в 5,65–6,60 раза относительно варианта с крупной моделью. Итоговая модель сохранила 77,53–83,67% результата селектора, обученного на Qwen2.5-7B-Instruct. Такой обмен подходит для первичного ранжирования большого пула, если полное обучение селектора на целевой модели слишком дорого.

Для команды, которая уже фильтрует данные энтропией, сложностью или близостью к домену, TESS добавляет ещё один вариант: обучать критерий непосредственно под проверочную задачу. Практический пилот можно ограничить частью корпуса, сравнить рейтинг с эвристиками и случайным отбором, а качество измерить после одинакового дообучения целевой модели.

Менять весь конвейер подготовки данных по этой работе рано. Эксперименты относятся к безопасности и целевому дообучению инструкциям на нескольких семействах моделей. Зато результат меняет устройство пилота: переносимость селектора теперь стоит проверять отдельно от качества весов на обучающем наборе, а функцию ScaleBiO не следует напрямую переносить на общую сеть.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу