Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
LLM научили с нуля следовать инструкциям, рассуждать и запоминать факты без раздельных стадий обучения. В препринте, который не прошёл рецензирование и приводит замеры самих авторов, модели Baguettotron приблизились к открытым аналогам, хотя получили в 80–700 раз меньше обучающих токенов. Для небольших общих и отраслевых моделей управляемый корпус становится альтернативой дальнейшему наращиванию веб-данных.
Как из отобранных статей собрали учебную программу
Основа Synth — 58 698 статей Wikipedia, отобранных по важности и дополненных материалами по праву, медицине и химии. К ним добавили страницы Wikibooks с рецептами и практическими знаниями, а также документы о недавних событиях и исследованиях ИИ. Из этих источников получили почти 80 млрд токенов на восьми языках.
Корпус называют полностью синтетическим не потому, что факты придумала модель. Реальные тексты служат опорой, но в обучение целевой LLM попадают созданные по ним запросы, ответы, задачи и цепочки рассуждений. Так команда контролирует, какие знания модель должна запомнить и в каких формах встретить их во время обучения.
Одна вспомогательная модель составляет запрос к фрагменту источника. Другая получает запрос, исходный фрагмент и близкий по смыслу отрывок, после чего строит ответ и ход рассуждения. Условия меняют тип задачи, сложность, язык, стиль и ожидаемый результат, поэтому генерация не сводится к повторению одного шаблона.
Пятая часть запросов требует отказаться от ответа, исправить ложную предпосылку или отметить неоднозначность. Без таких примеров синтетический корпус учил бы модель уверенно отвечать на любой вопрос: для каждой обычной записи у генератора уже есть подходящий исходный текст.
Кроме вопросов по фактам, в смесь вошли поиск ответа по предоставленным документам, арифметика, редактирование, перевод, творческие задания и вопросы с вариантами ответа. Рассуждения записывали сокращёнными служебными символами, чтобы небольшая модель помещала больше шагов в ограниченный контекст.
Рецепт остаётся одноэтапным только для целевой модели. Сам корпус требует отдельной подготовки генераторов и массового выпуска примеров, но Baguettotron затем учится одной обычной задачей предсказания следующего токена. Отдельная настройка на диалогах и обучение с подкреплением ей не нужны.
Что дала синтетика при равном объёме вычислений
Авторы обучили плотные модели размером до 600 млн параметров и модель со смесью экспертов: в ней 13 млрд параметров всего, но для каждого токена работает около 1 млрд. Проверка охватывает вопросы с вариантами ответа, открытые задания, точность воспроизведения фактов, отраслевую адаптацию и вызов инструментов.
Baguettotron уступил Qwen3-0.6B в среднем на 4,7 пункта в заданиях с вариантами ответа и на 0,7 пункта в открытых заданиях. Разница зависит от предмета: Synth лучше держится там, где знания представлены в исходных статьях, и заметнее отстаёт в задачах, которые требуют широкого охвата веб-контента.
Контрольный опыт отделяет влияние корпуса от архитектуры. Модели той же конфигурации обучили на FineWiki и FinePDFs-Edu. Без дополнительной настройки они не выдавали корректные ответы в нужном формате, тогда как модель на Synth справлялась сразу после основной стадии; дополнительное обучение веб-моделей сократило, но не закрыло разрыв.
Цепочки рассуждений оказались не декоративной частью данных. Когда их убрали, сохранив архитектуру, объём обучения и исходные факты, модель хуже отвечала на вопросы о достоверности и предметных областях. Значит, выигрыш даёт не только повторение отобранных знаний, но и заранее спроектированные способы работы с ними.
Граница результата проходит по исходному набору. Англоязычная Wikipedia определяет культурный и предметный охват, а сложность заданий рассчитана прежде всего на небольшие модели. Работа показывает эффективность рецепта в исследованном масштабе, но не подтверждает, что тот же состав данных заменит веб-корпус при обучении более крупных общих моделей.
Когда команде стоит менять план обучения
Работа меняет план там, где важнее управлять знаниями и поведением модели, чем охватить весь интернет. Это отраслевые помощники, внутренние базы знаний и модели для языков или предметов, по которым мало готовых диалогов. Вместо ручной подготовки каждой инструкции команда может взять проверенный корпус, задать набор задач и синтетически усилить его.
Экономия токенов не означает автоматической экономии всего проекта. Сначала нужно обучить или настроить генераторы, организовать поиск по исходным документам, проверить факты и следить за разнообразием запросов. Проект переносит часть затрат с обучения целевой LLM на проектирование данных, зато делает происхождение знаний и набор навыков контролируемыми.
Для общей модели с широким знанием мира Synth пока разумнее рассматривать как компонент смешанного корпуса, а не полную замену веб-данным. Для небольшой специализированной модели вывод практичнее: сначала стоит проверить качество синтетического усиления на фиксированной архитектуре, а уже затем увеличивать число параметров или собирать больше неуправляемого текста.
Корпус Synth и модели Baguettotron выпущены с разрешительной лицензией. Это позволяет воспроизвести рецепт и провести собственное сравнение на фактах и задачах конкретной предметной области, не восстанавливая описанную систему только по статье.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



