Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
LLM научили подбирать параметры нейтронного прибора так, чтобы проект проходил физическую проверку. Lijie Ding и Changwoo Do из Oak Ridge National Laboratory подняли долю решённых Qwen3-8B задач с 11% до 77% в препринте, который не прошёл рецензирование и содержит замеры самих авторов. Работа предлагает практическую схему для команд, у которых уже есть быстрый симулятор и измеримые физические ограничения.
Как физика заменяет модель-оценщик
NeutronGym строится вокруг McStas — отраслевого симулятора нейтронных приборов. Прибор задаётся текстовым списком источников, оптических элементов, образцов и датчиков, после чего McStas компилирует описание и методом Монте-Карло рассчитывает интенсивность, расходимость и распределение нейтронов по длинам волн.
Агент не получает оболочку операционной системы и не редактирует файлы напрямую. Он работает через 22 инструмента: ищет доступные компоненты, размещает их, задаёт параметры, запускает расчёт и читает сводные показатели. Инструменты сразу отклоняют неизвестный компонент, опечатку в параметре или значение за допустимой границей.
Оценка устроена как лестница. Сначала среда проверяет синтаксис, границы параметров и геометрию, затем запускает короткую симуляцию, проверяет полноценный расчёт и только после этого оценивает физический результат. Агент получает частичный балл за каждый пройденный этап и дополнительный балл за приближение к целевому значению.
В задачах на максимизацию среда также применяет закон сохранения фазовой плотности: пассивная нейтронная оптика не может передать больше частиц, чем допускают источник и приёмная область. Это не даёт агенту получить высокий балл через физически невозможную интенсивность. В задачах на совпадение среда сравнивает рассчитанные показатели с результатом скрытого проекта, поэтому простое увеличение потока не помогает.
Число частиц и начальное случайное состояние задаёт сама среда. Агент не может выбрать удачный шумный запуск или сократить расчёт так, чтобы случайная флуктуация выглядела улучшением. Итоговый балл выводится из выполненной симуляции, а не из ответа LLM-оценщика, который мог бы предпочесть убедительное объяснение рабочему проекту.
Почему симулятора недостаточно для честной задачи
Даже корректный физический расчёт не гарантирует, что агент чему-то научился. Один набор параметров может случайно подходить большинству заданий, а правило вроде «перепиши границы из условия» — обходить поиск проекта. Авторы проверяли каждое процедурное семейство фиксированным ответом, простым правилом по тексту задания и переносом решений между экземплярами.
Четыре варианта задач не прошли такую проверку. В одном случае почти все экземпляры решало копирование двух значений из условия, в другом скрытый проект слабо ограничивал допустимые решения. Эти результаты показывают, что генератор задач тоже приходится тестировать как часть системы оценки, а не считать разнообразие входных данных доказательством сложности.
Для проверки на реальных приборах авторы собрали McStasBench из опубликованных схем. Песочница блокировала доступ к штатным примерам McStas и чужим файлам, а отдельные тесты проверяли, не воспроизводит ли модель запомненный проект. Лучший результат составил 7 из 16 заданий на восстановление прибора; целевое улучшение существующей схемы не выполнила ни одна модель.
Этого набора достаточно, чтобы показать возможность восстановления прибора по спецификации, но недостаточно для рейтинга моделей. Каждый запускали только один раз на небольшой группе задач, а различия между результатами находились в пределах погрешности.
Что NeutronGym меняет в планах разработки
Работа меняет план разработки там, где продукт уже можно проверить исполняемой моделью мира. Вместо сбора эталонных ответов команда может определить последовательность технических и предметных проверок, давать частичный балл за приближение к цели и создавать новые задания из диапазонов параметров.
Форма награды здесь важнее выбранного алгоритма обучения. Когда авторы заменили лестницу одним итоговым ответом «прошёл или не прошёл», результат упал на 60 процентных пунктов. Обычное обучение на собственных удачных примерах модели тоже ухудшало качество, тогда как обучение с подкреплением позволяло исследовать промежуточные решения и использовать обратную связь симулятора.
Полученный навык не равен самостоятельному проектированию научного прибора. Во всех оцениваемых процедурных задачах схема оставалась фиксированной, а агент настраивал два-три параметра. Симуляция использовала идеальные датчики, не учитывала фон и отключала гравитацию; большинство конфигураций обучения проверили с единственным начальным случайным состоянием.
Обученная небольшая модель обошла более крупную необученную, но передовые модели всё ещё решали почти все задачи того же типа. Классический оптимизатор сравнялся с обученным агентом, когда получил готовые физические формулы. Поэтому NeutronGym пока подтверждает не преимущество LLM над инженерной оптимизацией, а более узкий вывод: физически проверяемая среда может научить модель восстанавливать полезное правило из награды.
Для команды это шаблон архитектуры, а не готовая замена инженерного расчёта. Он применим, если симулятор работает достаточно быстро для многократных запусков, ограничения можно проверять автоматически, а простые стратегии проходят отдельные тесты на обход задачи. Выбор топологии, перенос из идеальной симуляции в реальную установку и устойчивость обучения работа пока не подтверждает.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



