Журнал · Rit.work

FAER выбирает траектории по эффекту на модель

FAER отделяет правильность записей в кэше от их реальной пользы при дообучении языковой модели.

Rit.work
Студия разработки
2 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Правильность сохранённого ответа оказалась плохим ориентиром для выбора данных, на которых повторно дообучают LLM. В препринте FAER, который пока не рецензирован и где числа получили сами авторы, FAER-UTILITY поднял долю правильных ответов Qwen2.5-1.5B-Instruct до 66,2% против 60,4% у отбора по формату. При ограниченном бюджете обучения полезнее оценивать будущий эффект обновления, а не чистоту кэша.

FAER разделяет два измерения. Первое показывает, сколько правильных ответов попало в выбранную пачку полных траекторий — запросов, ходов решения и ответов. Второе проверяет модель после дообучения на отложенных задачах: эти показатели могут ранжировать способы отбора по-разному.

Чтобы сравнение можно было проверить, алгоритм видит только заранее объявленные поля: статус формата, уверенность проверяющей модели, уверенность генератора, длину и идентификатор записи. Система фиксирует выбранные идентификаторы и контрольную сумму траекторий до того, как добавляет правильные ответы. Это не даёт алгоритму случайно использовать целевую разметку и позволяет восстановить его решение.

FAER-UTILITY дополнительно оценивает, поможет ли конкретная траектория уменьшить ошибку на отдельном калибровочном наборе. Для этого он сравнивает градиенты — направления, в которых примеры меняют веса модели. Параметры подбирают на блоках, отделённых от целевых данных, а затем замораживают перед отбором.

Разрыв виден на эвристиках. Отбор по формату собрал 69,5% правильных записей, а фиксированный алгоритм FAER — только 35,9%. После одинакового дообучения порядок перевернулся: фиксированный вариант достиг 63,3% и обошёл форматную эвристику. Значит, пачка внешне качественных ответов не обязательно создаёт полезные обновления весов.

Главное сравнение провели на математическом наборе GSM8K с Qwen2.5-1.5B-Instruct. Для всех вариантов сохранили одну модель, оптимизатор, горизонт обучения, ограничения на вычисления и закрытый набор заданий. Поэтому результат напрямую относится к отбору полных траекторий для математического дообучения при фиксированном бюджете.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу