Журнал · Rit.work

ToolGate: как отбирать научные задачи, требующие запуска программы

Авторы ToolGate предложили проверять сгенерированные научные задачи исполнением кода, тестом без инструментов и независимым решением с доступом к специализированному ПО.

Rit.work
Студия разработки
3 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Ke Zhang и соавторы предложили ToolGate — конвейер отбора сгенерированных научных задач, описанный в препринте, который не проходил рецензирования. До итогового набора дошло меньше трети кандидатов. Подход важен командам, которые строят оценки для научных агентов и хотят автоматизировать первичную проверку, не отказываясь от экспертной ревизии.

Что сделали

Генератор создаёт вопрос с вариантами ответа, предполагаемый ответ и исполняемый сценарий для специализированного ПО. ToolGate проводит три проверки. Сначала независимо запускает сохранённый сценарий и сверяет его результат с предложенным ответом. Затем показывает только условие и варианты моделям без доступа к файлам, выполнению кода и целевому ПО: если модель стабильно отвечает правильно, задача считается слишком лёгкой. Наконец, отдельный агент получает чистое рабочее окружение и должен самостоятельно написать решение с использованием научного инструмента за ограниченное время.

Авторы испытали схему на FEniCSx — программном комплексе для численного решения дифференциальных уравнений методом конечных элементов. Из 500 попыток после всех фильтров и удаления точных повторов осталось 128 уникальных задач. Порядок вариантов перемешивали, а ответы сверяли по значениям: первоначальная проверка с фиксированным порядком принимала предпочтение модели к определённой букве за признак сложности.

Что это значит

Работа показывает практическую схему приёмки: результат генератора считается кандидатом, пока правильность ответа не подтверждена запуском, задача не отсеяна моделями без инструмента и не решена независимым агентом с инструментом. Для производственного конвейера полезна и сохраняемая история решений каждого фильтра: правила отбора можно повторно применить после смены модели или вычислительного бюджета. Экспертам при этом остаются проектирование предметной области, анализ покрытия и финальная проверка.

Ограничения. Авторы проверяли ToolGate в одной предметной области, с одним семейством генераторов и узким набором повторяющихся шаблонов. Сравнение не отделяет эффект доступа к FEniCSx от преимуществ многошагового агента с рабочим окружением и не сопоставляет затраты с ручной подготовкой задач. Кроме того, последующий аудит обнаружил повторяющийся дефект структуры данных в 97 из 130 задач до удаления повторов. Поэтому успешный запуск сценария подтверждает воспроизводимость ответа, но не полную смысловую корректность условия; перенос схемы на другое научное ПО в работе не измерен.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу