Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Правильность сохранённого ответа оказалась плохим ориентиром для выбора данных, на которых повторно дообучают LLM. В препринте FAER, который пока не рецензирован и где числа получили сами авторы, FAER-UTILITY поднял долю правильных ответов Qwen2.5-1.5B-Instruct до 66,2% против 60,4% у отбора по формату. При ограниченном бюджете обучения полезнее оценивать будущий эффект обновления, а не чистоту кэша.
FAER разделяет два измерения. Первое показывает, сколько правильных ответов попало в выбранную пачку полных траекторий — запросов, ходов решения и ответов. Второе проверяет модель после дообучения на отложенных задачах: эти показатели могут ранжировать способы отбора по-разному.
Чтобы сравнение можно было проверить, алгоритм видит только заранее объявленные поля: статус формата, уверенность проверяющей модели, уверенность генератора, длину и идентификатор записи. Система фиксирует выбранные идентификаторы и контрольную сумму траекторий до того, как добавляет правильные ответы. Это не даёт алгоритму случайно использовать целевую разметку и позволяет восстановить его решение.
FAER-UTILITY дополнительно оценивает, поможет ли конкретная траектория уменьшить ошибку на отдельном калибровочном наборе. Для этого он сравнивает градиенты — направления, в которых примеры меняют веса модели. Параметры подбирают на блоках, отделённых от целевых данных, а затем замораживают перед отбором.
Разрыв виден на эвристиках. Отбор по формату собрал 69,5% правильных записей, а фиксированный алгоритм FAER — только 35,9%. После одинакового дообучения порядок перевернулся: фиксированный вариант достиг 63,3% и обошёл форматную эвристику. Значит, пачка внешне качественных ответов не обязательно создаёт полезные обновления весов.
Главное сравнение провели на математическом наборе GSM8K с Qwen2.5-1.5B-Instruct. Для всех вариантов сохранили одну модель, оптимизатор, горизонт обучения, ограничения на вычисления и закрытый набор заданий. Поэтому результат напрямую относится к отбору полных траекторий для математического дообучения при фиксированном бюджете.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



