Журнал · Rit.work

Маленькие трансформеры стали лабораторией задержанной генерализации

Законы, точно измеренные на полностью перечислимых задачах и модели с 12 тысячами параметров, сохранились при росте модели до 50 миллионов параметров.

Rit.work
Студия разработки
18 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Маленькие трансформеры предложили использовать как лабораторный прибор для изучения задержанной генерализации: модель сначала запоминает обучающие данные, а заметно позже находит общее правило. Хотя препринт не рецензирован и числа получил сам автор, две из трёх проверенных закономерностей сохранились при росте модели с 12 тысяч до 50 миллионов параметров. Это позволяет сначала ставить дешёвые точные опыты, а затем проверять найденные закономерности на более крупных моделях.

Yoshiyuki Ootani обучал трансформеры на задачах, где можно перебрать все входы. Такой масштаб позволяет вычислить максимально достижимую точность для каждого разбиения данных, проверить модель на каждом примере и наблюдать все её веса. Вместо нескольких дорогих запусков можно сравнивать десятки начальных состояний и учитывать случаи, когда модель не успела обобщить за отведённое время.

Точный предел качества выдержал проверку: модели не превысили его ни в одном из 144 сравнений. Сохранилась и вторая закономерность: чем сильнее расходились роли кодов двух операндов, тем позже модель находила общее правило. Увеличение размера не устранило этот конфликт — на одинаковом числе эпох крупные модели переносили его хуже.

Третья закономерность изменилась. Реакция на затухание весов, то есть штраф за большие значения параметров, становилась резче с ростом модели, а прежний спад при сильном штрафе в проверенном диапазоне не появился. Это важная проверка самого подхода: маленькая модель переносит на крупную не все количественные зависимости без поправок.

Опыты охватили модели на 12 тысяч, 1 миллион и 50 миллионов параметров, обученные с нуля на модульной арифметике и искусственных задачах с конфликтом ролей. Во всех основных сериях использовали одну архитектурную семью, AdamW и одинаковый бюджет обучения. Поэтому результат поддерживает маленькие перечислимые задачи как инструмент для исследования причин задержанной генерализации, но не показывает напрямую, как поведёт себя продуктовая LLM на естественном языке.

Источники

Иллюстрация: рисунок из статьи «Small Enough to Know Everything: The Fully-Enumerable Transformer as an Instrument for the Science of Delayed Generalization», Yoshiyuki Ootani, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу