Журнал · Rit.work

Invent-a-Dataset создаёт обучающие данные без исходных примеров

Invent-a-Dataset генерирует по описанию текстовые датасеты для пост-обучения и превосходит прямые запросы к пяти моделям по качеству и разнообразию.

Rit.work
Студия разработки
2 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Датасет для пост-обучения можно собрать по одному текстовому описанию, без исходных примеров. Хотя препринт не рецензировали и все числа получили сами авторы, Invent-a-Dataset обошёл сильнейшие сравниваемые API на 17% по качеству и на 19% по разнообразию. Это позволяет проверить новую способность модели, не начиная проект со сбора корпуса вручную.

Invent-a-Dataset принимает описание нужных данных и возвращает готовый текстовый набор через отдельный API. В описании можно задать предметную область, язык, тон и формат ответа — например, юридические вопросы с четырьмя вариантами или объявления об автомобилях на сербском в JSON.

Систему сравнили с прямой генерацией через Claude Opus 5, GPT-5.6 Sol, Gemini-3.1-pro, GLM-5.3 и DeepSeek-V4-Pro. Для сторонних моделей выбирали самый разнообразный практический режим: они выдавали столько примеров за запрос, сколько позволял предел ответа. Invent-a-Dataset создавал весь набор одним вызовом.

Качество ответов проверяла модель-оценщик по заданным критериям, а смысловое разнообразие измеряли через DCScore: показатель учитывает, насколько примеры отличаются друг от друга по содержанию. При росте датасета до 20 000 записей преимущество Invent-a-Dataset по разнообразию достигло 37%, тогда как качество осталось стабильным.

Проверка охватила восемь типов задач — от поддержки клиентов до медицинских вопросов — с обычными и жёстко заданными форматами. Датасеты также использовали для дообучения моделей разных семейств: варианты на данных Invent-a-Dataset ранжировались выше вариантов, обученных на синтетических данных остальных генераторов. При этом работа относится к текстовым наборам инструкций и предпочтений; трассировки вызовов инструментов, многошаговые сценарии агентов и другие модальности в эксперимент не входили.

Для продуктовой команды результат сокращает путь от описания новой функции до эксперимента с дообучением. Отдельное практическое отличие — лицензия Invent-a-Dataset разрешает коммерческое обучение на результатах, тогда как условия части сравниваемых закрытых API запрещают использовать их ответы для этой цели.

Источники

Иллюстрация: рисунок из статьи «Invent a Dataset: Measuring dataset generation abilities with zero seed», Shivalika Singh, Andrija Djurisic, Gbemileke Onilude и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу