Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Ke Zhang и соавторы предложили ToolGate — конвейер отбора сгенерированных научных задач, описанный в препринте, который не проходил рецензирования. До итогового набора дошло меньше трети кандидатов. Подход важен командам, которые строят оценки для научных агентов и хотят автоматизировать первичную проверку, не отказываясь от экспертной ревизии.
Что сделали
Генератор создаёт вопрос с вариантами ответа, предполагаемый ответ и исполняемый сценарий для специализированного ПО. ToolGate проводит три проверки. Сначала независимо запускает сохранённый сценарий и сверяет его результат с предложенным ответом. Затем показывает только условие и варианты моделям без доступа к файлам, выполнению кода и целевому ПО: если модель стабильно отвечает правильно, задача считается слишком лёгкой. Наконец, отдельный агент получает чистое рабочее окружение и должен самостоятельно написать решение с использованием научного инструмента за ограниченное время.
Авторы испытали схему на FEniCSx — программном комплексе для численного решения дифференциальных уравнений методом конечных элементов. Из 500 попыток после всех фильтров и удаления точных повторов осталось 128 уникальных задач. Порядок вариантов перемешивали, а ответы сверяли по значениям: первоначальная проверка с фиксированным порядком принимала предпочтение модели к определённой букве за признак сложности.
Что это значит
Работа показывает практическую схему приёмки: результат генератора считается кандидатом, пока правильность ответа не подтверждена запуском, задача не отсеяна моделями без инструмента и не решена независимым агентом с инструментом. Для производственного конвейера полезна и сохраняемая история решений каждого фильтра: правила отбора можно повторно применить после смены модели или вычислительного бюджета. Экспертам при этом остаются проектирование предметной области, анализ покрытия и финальная проверка.
Ограничения. Авторы проверяли ToolGate в одной предметной области, с одним семейством генераторов и узким набором повторяющихся шаблонов. Сравнение не отделяет эффект доступа к FEniCSx от преимуществ многошагового агента с рабочим окружением и не сопоставляет затраты с ручной подготовкой задач. Кроме того, последующий аудит обнаружил повторяющийся дефект структуры данных в 97 из 130 задач до удаления повторов. Поэтому успешный запуск сценария подтверждает воспроизводимость ответа, но не полную смысловую корректность условия; перенос схемы на другое научное ПО в работе не измерен.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



