Журнал · Rit.work

sTCL обучает производные нейрооператора без предварительных меток

sTCL переносит контроль производных нейрооператора в цикл обучения, но требует известного уравнения и отдельной настройки потерь под свойства касательного оператора.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Производные нейрооператора можно контролировать прямо во время обучения, не рассчитывая и не сохраняя эталонные производные заранее. В нерецензированном препринте, где все числа получили сами авторы, sTCL показал сопоставимую с DIFNO точность решений и якобианов. Для проектов с известным уравнением это убирает отдельный конвейер подготовки производных, но не отменяет настройку потерь под конкретную физическую задачу.

Случайные направления заменяют набор эталонных производных

Нейрооператор получает на вход функцию с параметрами задачи и предсказывает функцию решения дифференциального уравнения. В оптимизации, управлении и обратных задачах важен не только сам ответ, но и его изменение при малом возмущении входа. Это изменение задаёт якобиан нейрооператора.

Обычная точность решения не гарантирует точный якобиан. Модель может хорошо воспроизводить поле скорости или температуры, но давать неверное направление градиента, из-за чего следующий шаг оптимизатора ухудшит проект вместо улучшения.

DIFNO и другие методы обучения на производных заранее решают линеаризованное уравнение для выбранных входов и направлений возмущения. Полученные отклики становятся метками, которые нужно хранить вместе с основным набором данных. При смене разрешения, распределения входов или базиса возмущений этот набор приходится строить заново.

sTCL действует иначе. На каждом обновлении он выбирает случайные направления во входном пространстве, вычисляет произведения якобиана модели на эти направления с помощью автоматического дифференцирования и подставляет результат в линеаризованное уравнение. Если производная модели верна, остаток уравнения близок к нулю.

Случайные направления работают как эскизы большого якобиана: в среднем их ошибка оценивает энергию полного остатка. В основных опытах для каждого обучающего примера брали четыре направления. Полную матрицу якобиана не строили, а штраф sTCL добавляли к обычной ошибке предсказания.

Метод не требует менять архитектуру нейрооператора. Однако ему нужны известное дифференцируемое уравнение, вычислимый остаток и доступ к действию его линеаризации на вектор. Для симулятора, который доступен только как чёрный ящик, такой способ не подходит.

Плохо обусловленный оператор требует другой функции потерь

Простой штраф за остаток производной работает не для каждого уравнения. У жёсткого, неопределённого или связанного касательного оператора маленький остаток может плохо отражать ошибку производной, а градиент функции потерь — давать слабый сигнал для обучения.

Поэтому sTCL — не одна универсальная формула. Для симметричных положительно определённых эллиптических задач авторы взвешивают остаток приближённым обратным лапласианом. Для параболических уравнений достаточно исходного или слегка скорректированного остатка.

В Helmholtz касательный оператор симметричен, но может быть неопределённым около резонансных режимов. Здесь из нескольких итераций MINRES строят приближённую целевую производную и сравнивают с ней результат модели. Переход от одной внутренней итерации к трём снизил ошибку якобиана с 23,03% до 15,52%; дальнейшее увеличение числа шагов давало небольшую прибавку при продолжающемся росте времени обучения.

Для стационарного Navier–Stokes авторы отдельно учитывают связанную систему скорости, давления и условия несжимаемости через взвешивание Leray–Oseen. Оно сохраняет обучение без предварительных меток, но делает каждое обновление дороже из-за дополнительных касательных остатков.

Планы меняются там, где производные уже стали узким местом

Метод проверили на пяти уравнениях: Helmholtz, нелинейной диффузии с реакцией, Burgers, Allen–Cahn и стационарном Navier–Stokes. Для каждого использовали три объёма обучающих данных, одинаковую основу FNO и общий протокол сравнения. Оценивали как ошибку решения, так и ошибку произведения якобиана на направление.

sTCL не выиграл у DIFNO во всех условиях. На нелинейной диффузии и Navier–Stokes предварительные метки чаще давали более точный якобиан, а на Helmholtz результат зависел от объёма данных. Зато в крупнейшем опыте Burgers ошибка sTCL составила 73,53% против 178,08% у DIFNO: производная, вычисленная около текущего прогноза модели, оказалась устойчивее сохранённых меток.

Главное практическое изменение касается не архитектуры, а подготовки данных. Если команда уже решает касательные уравнения перед каждым обучением и хранит их результаты, sTCL позволяет перенести этот контроль в обучающий цикл. Время самого обучения осталось сопоставимым с DIFNO, при этом предварительные расчёты DIFNO в сравнение не входили.

Перенос имеет смысл, когда распределение входов, разрешение сетки или направления возмущений часто меняются. Команда избавляется от пересборки набора производных, но должна реализовать дифференцируемый остаток и подобрать способ обусловливания для своего касательного оператора. Работа показывает не готовую универсальную потерю, а схему выбора: случайные направления сокращают вычисления, а структура уравнения определяет, как превратить остаток в полезный обучающий сигнал.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу