Журнал · Rit.work

Бенчмарк LLM может измерять ошибку контура вместо качества метода

Аудит сравнения методов обучения LLM нашёл четыре детали тренировочного контура, которые меняли итоговый рейтинг или его смысл.

Rit.work
Студия разработки
5 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Детали тренировочного контура могут перевернуть результат сравнения методов обучения LLM на устаревших данных. Хотя препринт Taiheng Pan из The University of Melbourne не рецензирован и числа в нём получил сам автор, после исправления настроек TIS сравнялся с SAN в verl, хотя сначала SAN лидировал. Для аудита бенчмарка недостаточно смотреть на итоговую точность: нужно проверять, какие данные, вероятности и параметры фактически получил каждый метод.

Работа разбирает обучение на ответах, которые сгенерировала более ранняя версия модели. Автор нашёл четыре детали контура. Отношение вероятностей PPO считали относительно заново вычисленных вероятностей самой обучаемой модели, поэтому ограничение не работало. Настройка порядка данных не доходила до запусков TIS, первая пачка повторялась на 33 шагах, а два способа нормировки функции потерь не совпадали с описанием. Три детали меняли результат, четвёртая — смысл сравнения.

После проверки контура TIS завершил прогоны в verl с точностью 76–79% на GSM8K и оказался на уровне SAN+. В отдельном тренажёре на одной GPU TIS перестал деградировать, когда каждый шаг начал получать новую пачку, однако SAN сохранил преимущество в 7–10 процентных пунктов. Особенно показателен прежний журнал: возраст данных выглядел правильным, хотя модель десятки раз училась на одной пачке.

Проверка охватывала Qwen2.5-Math-1.5B, задачи GSM8K, среду verl и отдельный тренажёр на одной GPU. Сравнивали SAN, TIS и GRPO при задержке обновления генератора; поэтому вывод относится к контурам, где обучаемая модель работает с ответами от отстающей версии.

Предложенный набор проверок PTH превращает аудит в воспроизводимую процедуру: записывать отношение вероятностей к модели, которая действительно сгенерировала ответ; печатать итоговую конфигурацию каждого запуска; сверять идентификаторы пачек; тестировать реализованную функцию потерь на фиксированном входе; сравнивать методы попарно при одинаковом порядке данных. Такой журнал показывает не только метрику, но и то, какой эксперимент код провёл на самом деле.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу