Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Детали тренировочного контура могут перевернуть результат сравнения методов обучения LLM на устаревших данных. Хотя препринт Taiheng Pan из The University of Melbourne не рецензирован и числа в нём получил сам автор, после исправления настроек TIS сравнялся с SAN в verl, хотя сначала SAN лидировал. Для аудита бенчмарка недостаточно смотреть на итоговую точность: нужно проверять, какие данные, вероятности и параметры фактически получил каждый метод.
Работа разбирает обучение на ответах, которые сгенерировала более ранняя версия модели. Автор нашёл четыре детали контура. Отношение вероятностей PPO считали относительно заново вычисленных вероятностей самой обучаемой модели, поэтому ограничение не работало. Настройка порядка данных не доходила до запусков TIS, первая пачка повторялась на 33 шагах, а два способа нормировки функции потерь не совпадали с описанием. Три детали меняли результат, четвёртая — смысл сравнения.
После проверки контура TIS завершил прогоны в verl с точностью 76–79% на GSM8K и оказался на уровне SAN+. В отдельном тренажёре на одной GPU TIS перестал деградировать, когда каждый шаг начал получать новую пачку, однако SAN сохранил преимущество в 7–10 процентных пунктов. Особенно показателен прежний журнал: возраст данных выглядел правильным, хотя модель десятки раз училась на одной пачке.
Проверка охватывала Qwen2.5-Math-1.5B, задачи GSM8K, среду verl и отдельный тренажёр на одной GPU. Сравнивали SAN, TIS и GRPO при задержке обновления генератора; поэтому вывод относится к контурам, где обучаемая модель работает с ответами от отстающей версии.
Предложенный набор проверок PTH превращает аудит в воспроизводимую процедуру: записывать отношение вероятностей к модели, которая действительно сгенерировала ответ; печатать итоговую конфигурацию каждого запуска; сверять идентификаторы пачек; тестировать реализованную функцию потерь на фиксированном входе; сравнивать методы попарно при одинаковом порядке данных. Такой журнал показывает не только метрику, но и то, какой эксперимент код провёл на самом деле.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



