Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Задачи для посттренинга LLM научились подстраивать под текущие способности модели, чтобы обучение не останавливалось после освоения фиксированного набора. В тесте Dice метод Frontier Learning довёл точность до 71,8% против 33,3% у лучшего базового подхода; это нерецензированный препринт, и все числа получили сами авторы. Такой генератор может продлить полезный этап обучения, если задачи допускают автоматическую проверку ответа.
Обычный посттренинг с GRPO даёт модели несколько попыток решить одну задачу и сравнивает результаты. Если все ответы верны или все ошибочны, алгоритм не получает полезного сигнала. Поэтому фиксированный набор быстро устаревает: лёгкие задачи модель уже освоила, а слишком трудные ещё не дают ей зацепки для обучения.
Frontier Learning создаёт задачи во время обучения. Метод хранит изменяемый набор уровней сложности, чаще выбирает уровни, где модель иногда справляется, и постепенно меняет их параметры. Случайный поиск добавляет новые области, а локальные изменения уже полезных уровней сдвигают задачи вслед за растущими способностями модели.
На трудных уровнях Dice точность достигла 72,6%, тогда как базовые методы остались ниже 5,5%. Их прогресс остановился в первой части длинного прогона, а Frontier Learning продолжил находить задачи, на которых ответы модели смешивали успехи и ошибки.
Метод проверили на пяти задачах по головоломкам, арифметике и графам, а также на семействах Qwen3, Llama и Olmo3. Его сравнили с фиксированным набором, случайным выбором уровней и адаптивными схемами отбора. Подход применим там, где задачу можно породить программно, менять её параметры и автоматически проверить ответ; для свободных текстовых задач работа таких условий не показывает.
Источники
Иллюстрация: рисунок из статьи «Frontier Learning: Training LLM Reasoners at the Edge of Capability», Robin Faro, Shyam Sundhar Ramesh, Ilija Bogunovic и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



