Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Рабочие задания для LLM-агентов научились собирать из публичных документов и проверять исполнением до обучения модели. В нерецензированном препринте WorkGenesis числа получены самими авторами: обученная на собранных заданиях Fx-Work-35B набрала в среднем 31,00 балла против 24,79 у сильнейшей сопоставимой по размеру базовой модели. Для команд это сдвигает узкое место с ручного написания сценариев на поиск надёжных исходных файлов и автоматическую проверку связности.
Как реальные файлы превращают в рабочее задание
WorkGenesis начинает не с просьбы к LLM придумать правдоподобную ситуацию, а с существующего документа. Справочник профессий O*NET задаёт специальность и тип работы, после чего система ищет в открытом доступе подходящие отчёты, таблицы, шаблоны и другие файлы.
Найденный документ становится фактической опорой сценария. WorkGenesis не переписывает его содержание, а достраивает недостающий контекст: создаёт сопутствующие материалы, формулирует запрос от условного заказчика и составляет критерии приёмки результата.
Готовая единица данных включает три связанные части: рабочий запрос, набор реальных и синтетических файлов, а также поэлементную шкалу оценки. Запрос описывает роль исполнителя, деловую ситуацию, цель, ограничения и формат результата. Каждый критерий должен проверяться по запросу или приложенным материалам, а не по скрытым знаниям модели-оценщика.
Система также хранит адреса и контрольные суммы уже использованных документов. Следующий сценарий не должен повторять прежний исходный файл или почти такую же ситуацию. Это снижает риск получить большой датасет из однотипных заданий, которые различаются только именами и формулировками.
Пробное выполнение находит противоречия в самом задании
Связный текст ещё не делает задачу выполнимой. Запрос может требовать сведений, которых нет в приложениях, а критерий приёмки — противоречить запросу или требовать неподдерживаемую материалами деталь.
Чтобы выявить такие ошибки, независимый агент получает только запрос, файлы и доступные инструменты. Он выполняет работу и создаёт эталонный результат так же, как это позже должен делать обучаемый агент. Затем модель-оценщик проверяет результат отдельно по каждому критерию.
Каждый недобранный пункт относят к одной или нескольким причинам. Агент мог не справиться с корректным требованием; сам критерий мог оказаться неверным; либо противоречие могло находиться в запросе и приложениях. Ошибку агента оставляют как свидетельство сложности, а дефекты задания и шкалы оценки используют для следующей редакции.
При исправлении реальный исходный документ остаётся неизменным. Система может переписать запрос, заменить синтетические приложения или уточнить критерии, после чего агент заново выполняет всю работу. Если дефект сохраняется после трёх циклов, сценарий отбрасывают и строят другой.
Для проверки подхода WorkGenesis охватил 65 профессий и собрал 20 тысяч заданий. Их последовательности действий и вызовов инструментов использовали для дообучения с учителем модели Qwen3.6-35B-A3B; результат получил название Fx-Work-35B. Модель проверяли на трёх наборах профессиональных задач: GDPvalAA-v2, APEX-Agents-AA и JobBench.
Командам нужен конвейер данных, а не только генератор заданий
Главный практический результат работы — не отдельная модель, а схема производства обучающих данных. Она разделяет фактическую основу, достроенный контекст, запрос, критерии и пробное исполнение. Благодаря этому ошибку можно связать с конкретной частью сценария и исправить до обучения.
Эффект виден на задачах, где агент должен долго работать с несколькими приложениями и инструментами. В APEX-Agents-AA доля полностью выполненных заданий выросла с 13,4% до 25,2%. Средняя стоимость прохождения одного задания на использованных авторами условиях составила $0,77.
Работа меняет планы команд, у которых уже накоплены документы, шаблоны, отчёты и примеры результатов. Вместо ручного написания каждого сценария можно строить конвейер вокруг этих материалов: выбирать опорный файл, добавлять контекст, формировать проверяемый результат и запускать аудит исполнением.
Простая генерация инструкций здесь недостаточна. Наиболее важная часть WorkGenesis — разбор причины ошибки: нужно отличить слабость агента от сломанного задания. Если автоматически исправлять всё, что не выполнила текущая модель, датасет станет проще, но не обязательно точнее.
Границы результата задаёт сам эксперимент: обучение прошло с учителем, а качество измеряли на профессиональных испытаниях, а не в производственном процессе компании. Поэтому подход уже даёт архитектуру конвейера данных, но не заменяет проверку на внутренних документах, инструментах и критериях конкретного продукта.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



