Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Датасет для пост-обучения можно собрать по одному текстовому описанию, без исходных примеров. Хотя препринт не рецензировали и все числа получили сами авторы, Invent-a-Dataset обошёл сильнейшие сравниваемые API на 17% по качеству и на 19% по разнообразию. Это позволяет проверить новую способность модели, не начиная проект со сбора корпуса вручную.
Invent-a-Dataset принимает описание нужных данных и возвращает готовый текстовый набор через отдельный API. В описании можно задать предметную область, язык, тон и формат ответа — например, юридические вопросы с четырьмя вариантами или объявления об автомобилях на сербском в JSON.
Систему сравнили с прямой генерацией через Claude Opus 5, GPT-5.6 Sol, Gemini-3.1-pro, GLM-5.3 и DeepSeek-V4-Pro. Для сторонних моделей выбирали самый разнообразный практический режим: они выдавали столько примеров за запрос, сколько позволял предел ответа. Invent-a-Dataset создавал весь набор одним вызовом.
Качество ответов проверяла модель-оценщик по заданным критериям, а смысловое разнообразие измеряли через DCScore: показатель учитывает, насколько примеры отличаются друг от друга по содержанию. При росте датасета до 20 000 записей преимущество Invent-a-Dataset по разнообразию достигло 37%, тогда как качество осталось стабильным.
Проверка охватила восемь типов задач — от поддержки клиентов до медицинских вопросов — с обычными и жёстко заданными форматами. Датасеты также использовали для дообучения моделей разных семейств: варианты на данных Invent-a-Dataset ранжировались выше вариантов, обученных на синтетических данных остальных генераторов. При этом работа относится к текстовым наборам инструкций и предпочтений; трассировки вызовов инструментов, многошаговые сценарии агентов и другие модальности в эксперимент не входили.
Для продуктовой команды результат сокращает путь от описания новой функции до эксперимента с дообучением. Отдельное практическое отличие — лицензия Invent-a-Dataset разрешает коммерческое обучение на результатах, тогда как условия части сравниваемых закрытых API запрещают использовать их ответы для этой цели.
Источники
Иллюстрация: рисунок из статьи «Invent a Dataset: Measuring dataset generation abilities with zero seed», Shivalika Singh, Andrija Djurisic, Gbemileke Onilude и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



