Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Веб-страницы для предобучения LLM научились превращать в чистый текст без отдельного парсера и набора ручных фильтров. ReScraper на 0,6 млрд параметров подготовил корпус, который повысил результат DCLM Core на 3,8–4,7% относительно сильнейших альтернатив. Препринт команды Carnegie Mellon University пока не рецензирован, а все числа получили сами авторы.
Модель сама решает, что сохранить на странице
Обычный конвейер сначала извлекает основной текст из HTML, а затем пропускает его через правила по длине, повторам и доле специальных символов. Большинство таких правил решает судьбу документа целиком: сохранить или удалить. Полезная статья с рекламным абзацем поэтому либо попадает в корпус вместе с шумом, либо исчезает полностью.
ReScraper получает весь видимый текст страницы, включая навигацию, боковые блоки и подвал. Каждая строка снабжена идентификатором, а модель выдаёт короткую программу обработки. Детерминированный исполнитель применяет её к исходному тексту, поэтому модель не обязана заново генерировать каждую сохранённую страницу.
Сначала ReScraper отмечает строки, которые не относятся к основному содержанию. Затем выбирает одно из четырёх действий: оставить извлечённый текст, удалить страницу, вырезать шумные строки и фрагменты либо переписать плохо оформленный, но содержательный материал. Последний вариант спасает данные, которые обычный фильтр отбросил бы целиком.
Обучающие примеры собрали из результатов трёх учителей. Dripper выделял основной текст, Qwen3.8-27B решал, что сохранить, удалить или отредактировать, а RePro переписывал полезные страницы низкого качества. Обучение разделили на этап, где модель осваивала короткие команды удаления, и этап с повышенной долей полного переписывания.
Объединение этапов оказалось важнее отдельного фильтра
Качество корпуса проверяли не оценкой самих очищенных страниц, а предобучением языковых моделей с нуля. Для сравнения использовали одинаковый исходный набор веб-страниц и одинаковые бюджеты обучения. DCLM Core усредняет нормированную точность по разным задачам: случайный ответ соответствует нулю, идеальный — единице.
ReScraper занял первое место на каждом проверенном масштабе. В сравнении участвовали конвейеры с правилами C4, RefinedWeb и FineWeb, модели редактирования ProX-C и UltraX, а также DataOrchestra, где отдельная модель направляет фрагменты к удалению строк или переписыванию.
Разбор отдельных операций показывает, что выигрыш даёт не только более точная фильтрация. Без извлечения основного текста итоговый Core падал на 16,6%, без переписывания — на 7,8%. Если заменить совместную обработку каскадом, где Dripper сначала извлекает текст, а ReScraper получает уже готовый результат, показатель снижался на 3,6%.
Причина в том, что ранняя ошибка обычно необратима. Если парсер потерял заголовок, структуру таблицы или часть статьи, следующий фильтр уже не восстановит контекст. Единая модель видит исходную страницу и одновременно учитывает её структуру, качество текста и дальнейшее действие.
Когда стоит пересмотреть конвейер подготовки данных
Проверка охватывает 18 млн англоязычных документов Common Crawl. На подготовленных корпусах обучали декодерные языковые модели размером от 400 млн до 2,8 млрд параметров, а затем оценивали их на 22 задачах DCLM Core. Вывод работы относится к предобучению на больших веб-корпусах, где страницы проходят извлечение, очистку и дедупликацию.
Для команды, которая собирает собственный веб-корпус, ReScraper меняет архитектурный выбор. Вместо расширения списка правил имеет смысл проверить одну обучаемую модель, которая читает представление исходной страницы и возвращает исполняемую программу очистки. Эксперимент показывает, что куратор данных может быть меньше модели, которую затем обучают на его корпусе.
Такая замена не сводится к установке ещё одного фильтра. Конвейеру нужно сохранять видимый текст и структуру строк, исполнять команды модели, отдельно проводить дедупликацию и контролировать переписанные документы. Политика очистки также заложена в примеры от учителей, поэтому для другого языка, домена или требований к допустимому редактированию понадобится собственная проверка и, вероятно, дообучение.
Работа не даёт оснований менять загрузку документов для поиска по базе знаний или обычного корпоративного анализа: там важнее точное сохранение источника, а не качество будущего предобучения. Практический сигнал уже уже: при подготовке больших веб-корпусов единый обучаемый обработчик стоит сравнивать не только с правилами, но и с каскадом специализированных моделей.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



