Журнал · Rit.work

MoFlow сохраняет выбор между качеством, стоимостью и задержкой

MoFlow за один поиск собирает агентные сценарии с разным балансом качества, расхода токенов и задержки, чтобы менять приоритеты без переобучения.

Rit.work
Студия разработки
1 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Один запуск поиска может собрать агентные сценарии под разные соотношения качества, стоимости и задержки, а затем выбирать из них без нового обучения. Команда University of Notre Dame и IBM показала это в MoFlow: в нерецензированном препринте, где все числа получили сами авторы, метод превзошёл лучший из сравниваемых подходов по охвату компромиссов на 10,9%. Для продукта с разными тарифами или требованиями ко времени ответа это переносит выбор режима из обучения в обычный поиск по готовому набору.

Как один поиск сохраняет разные компромиссы

Агентный сценарий здесь — граф из вызовов LLM и прикладных операций. Обычный генератор оценивает каждый граф одним числом: например, складывает точность и стоимость с заданными весами. Если веса меняются, поиск или обучение приходится запускать заново.

MoFlow не сводит критерии к одной оценке. В каждом узле дерева поиска он хранит набор достижимых результатов и отбрасывает только те, которые хуже другого варианта сразу по всем критериям. Так постепенно возникает Pareto-фронт (набор решений, где один критерий нельзя улучшить без ухудшения другого).

Сценарий строится последовательными правками графа. LLM предлагает следующую операцию и воплощает её, а поиск учитывает, что одна и та же команда может породить разные продолжения. На каждом проходе MoFlow выбирает новые веса критериев, но найденный результат добавляет ко всему набору, поэтому им могут воспользоваться и другие сочетания весов.

Незавершённый граф нельзя выполнить целиком, поэтому его будущий результат оценивает графовая нейросеть. Online MoFlow обучает её во время поиска на выполненных сценариях. Offline MoFlow заранее обучает оценщик на результатах прошлых запусков и затем исследует новые графы без их полного выполнения.

Метод сравнили с шестью генераторами на шести бенчмарках по математике, программированию и ответам на вопросы. Поиск одновременно учитывал пять критериев: точность, устойчивость к шуму, согласованность повторных запусков, расход токенов и число последовательных вызовов как меру задержки. Перенос между четырьмя базовыми моделями отдельно проверяли на математической задаче.

Offline MoFlow оказался дешевле, но использовал накопленные запуски

Качество набора сценариев измеряли гиперобъёмом: чем больше область результатов, которую покрывает найденный Pareto-фронт, тем шире доступный выбор между критериями. Конкурирующие методы получили преимущество — каждый из них заново запускали под проверяемые веса, тогда как MoFlow этих весов во время поиска не видел.

Offline MoFlow улучшил гиперобъём лучшего конкурента на 12,8% и потребовал не менее чем в 17 раз меньше токенов для поиска. Экономия относится именно к новому поиску: оценщик заранее обучили на выполнениях, собранных Online MoFlow, поэтому исходные вычисления не исчезают, а превращаются в повторно используемые данные.

Обе версии показали лучший гиперобъём на четырёх из шести наборов. На остальных отставание от лидера осталось меньше 1%. При разборе отдельных критериев MoFlow совпадал с лучшими конкурентами или опережал их на большинстве задач, то есть итог возник не только из удачного агрегирования метрик.

Проверка охватывает линейные сочетания заданных критериев: пользователь задаёт их веса, а система выбирает подходящий сценарий. Результат не показывает, как поиск поведёт себя с жёсткими ограничениями, нелинейными правилами выбора или метриками, которых не было при построении дерева.

Когда подход меняет архитектурный план

Работа меняет планы продукта, если баланс критериев должен меняться после запуска. Примеры — разные тарифы, отдельный режим для срочных запросов или возможность временно сократить расход токенов. Вместо отдельного генератора под каждый режим можно искать общий набор сценариев и выбирать вариант по текущим весам.

Для этого метрики нельзя рано объединять в одну оценку. Система должна хранить точность, расход, задержку, устойчивость и согласованность отдельно, а также сохранять сами недоминируемые сценарии. Выбор режима тогда становится дешёвой операцией без вызова LLM, но выполнение выбранного графа по-прежнему расходует токены и занимает время.

Для нового класса задач практичнее Online MoFlow: ему не нужен готовый набор запусков, хотя полное выполнение кандидатов делает поиск дорогим. Offline-вариант имеет смысл, когда команда уже накопила представительные графы и результаты их выполнения. Перенос оценщика на существенно другую задачу в работе не проверяли.

Если продукт всегда использует одно стабильное соотношение критериев, главное преимущество MoFlow исчезает: обычный поиск по единой оценке может оказаться проще. Метод полезен не как замена любого генератора сценариев, а как архитектура для случаев, где требования меняются чаще, чем команда готова повторять обучение и поиск.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу