Журнал · Rit.work

Grokking объяснили несовпадением областей низких потерь

Геометрическая модель связывает grokking со структурой данных и объясняет, почему изменение разбиения может убрать отложенное обобщение без смены модели и настроек обучения.

Rit.work
Студия разработки
2 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Поздний скачок качества на проверочных данных, известный как grokking, может полностью исчезнуть, если иначе разделить тот же набор примеров. В нерецензированном препринте Yongding Tian и соавторов все числа получили сами авторы: сохранение симметрии при разбиении удержало качество проверки низким во всех десяти запусках. Значит, число примеров и настройки обучения сами по себе не определяют, возникнет ли отложенное обобщение.

Работа связывает grokking с геометрией пространства параметров модели. Область низких потерь — это набор весов, при которых модель мало ошибается на выбранных данных. Обучающая и проверочная части создают свои области: если они частично не совпадают, модель может сначала попасть только в обучающую область, а затем перейти в общую. Этот запоздалый переход и выглядит как grokking.

Контрпример построили на модульном сложении с модулем 97. При обычном случайном разбиении пополам модель показывала grokking. Затем пары примеров, полученные перестановкой аргументов, стали всегда помещать в одну часть данных. Архитектура, оптимизатор, объём выборки и остальные настройки не изменились, но качество на проверке больше не восстановилось. При этом скачки функции потерь, которые раньше считали признаком будущего grokking, сохранились.

Эффект зависел не от строгого правила разбиения, а от его степени. Когда долю симметричных пар в одной части снижали со 100% в сторону 70%, отложенное обобщение постепенно возвращалось. Это поддерживает вывод, что важнее учитывать информацию и связи внутри выборки, а не только количество строк.

Основной контрпример проверяли на небольшом трансформере и синтетической арифметической задаче. Геометрию оценивали косвенно: искали пути с малой функцией потерь между независимо обученными моделями и сравнивали режимы обучения. Для продуктовых LLM результат пока служит диагностикой: длительное переобучение не стоит принимать за скрытую способность модели, пока не проверено, как устроено разбиение данных.

Источники

Иллюстрация: рисунок из статьи «Misalignment of Low-Loss Regions Causes Grokking», Yongding Tian, Zaid Al-Ars, Maksim Kitsak и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу