Журнал · Rit.work

Предобучение без корпуса: данные генерирует сама система

Два трансформера с нуля создали учебные последовательности, которые помогли предсказывать естественные данные, но эксперимент пока ограничен моделями меньше 25 млн параметров.

Rit.work
Студия разработки
25 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Модель научили лучше предсказывать следующий байт в текстах, изображениях и аудио, не обновляя её веса на естественных данных. Хотя препринт не рецензирован и все числа получили сами авторы, качество на незнакомых наборах предсказуемо росло вместе с затратами на вычисления. Для продуктовой разработки это пока не замена обычному предобучению, а возможный дополнительный этап перед ним.

Aditya Cowsik и соавторы обучали с нуля два трансформера. Генератор писал программы для минимальной универсальной машины Тьюринга, а та превращала их в последовательности байтов. Вторая модель училась предсказывать следующий байт. Генератор получал награду за последовательности, которые модель ещё не освоила, но уже могла использовать для дальнейшего прогресса. Так учебный материал менялся вместе со способностями модели, а не задавался заранее.

После такого обучения модель переносила найденные закономерности на тексты, код, изображения, речь, музыку, DNA и математические последовательности. Она также научилась продолжать новые закономерности по примерам в контексте, не меняя веса. Среди программ генератора появились известные математические последовательности — хотя их никто не закладывал в учебный набор напрямую.

Эксперименты охватывали модели меньше 25 млн параметров с контекстом 4096 токенов. Метод сравнивали с программами из фиксированного универсального распределения и вероятностными грамматиками: адаптивное самосоревнование давало закономерный рост качества в разных типах данных, тогда как фиксированные источники переносились не на все типы одинаково. Естественные данные всё же использовали при выборе гиперпараметров на DCLM и DNA, но не для обновления весов.

Практический вывод ограничен масштабом эксперимента. Работа не показывает, что корпус можно убрать из обучения большой LLM: факты о мире всё равно должны прийти из внешних данных. Она предлагает другую рамку — тратить вычисления не только на повторное чтение корпуса, но и на поиск синтетических структур, которые учат модель общим операциям вроде копирования, рекурсии и композиции.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу