Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Модель научили лучше предсказывать следующий байт в текстах, изображениях и аудио, не обновляя её веса на естественных данных. Хотя препринт не рецензирован и все числа получили сами авторы, качество на незнакомых наборах предсказуемо росло вместе с затратами на вычисления. Для продуктовой разработки это пока не замена обычному предобучению, а возможный дополнительный этап перед ним.
Aditya Cowsik и соавторы обучали с нуля два трансформера. Генератор писал программы для минимальной универсальной машины Тьюринга, а та превращала их в последовательности байтов. Вторая модель училась предсказывать следующий байт. Генератор получал награду за последовательности, которые модель ещё не освоила, но уже могла использовать для дальнейшего прогресса. Так учебный материал менялся вместе со способностями модели, а не задавался заранее.
После такого обучения модель переносила найденные закономерности на тексты, код, изображения, речь, музыку, DNA и математические последовательности. Она также научилась продолжать новые закономерности по примерам в контексте, не меняя веса. Среди программ генератора появились известные математические последовательности — хотя их никто не закладывал в учебный набор напрямую.
Эксперименты охватывали модели меньше 25 млн параметров с контекстом 4096 токенов. Метод сравнивали с программами из фиксированного универсального распределения и вероятностными грамматиками: адаптивное самосоревнование давало закономерный рост качества в разных типах данных, тогда как фиксированные источники переносились не на все типы одинаково. Естественные данные всё же использовали при выборе гиперпараметров на DCLM и DNA, но не для обновления весов.
Практический вывод ограничен масштабом эксперимента. Работа не показывает, что корпус можно убрать из обучения большой LLM: факты о мире всё равно должны прийти из внешних данных. Она предлагает другую рамку — тратить вычисления не только на повторное чтение корпуса, но и на поиск синтетических структур, которые учат модель общим операциям вроде копирования, рекурсии и композиции.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



