Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Для каждого запроса агентной системе научились выбирать сразу пару: LLM и контур исполнения, который управляет инструментами, памятью и ходом задачи. HM-Router из работы Imperial College London, Samsung и Institute of Science Tokyo обошёл лучший из проверенных обучаемых маршрутизаторов на 7,3 процентного пункта, хотя препринт не рецензирован и все числа получили сами авторы. Для команд с несколькими моделями и агентными контурами это меняет сам объект маршрутизации: сравнивать нужно не модели по отдельности, а рабочие сочетания.
Почему лучшая модель зависит от контура исполнения
Контур исполнения (harness) определяет, как модель получает наблюдения, вызывает инструменты, хранит промежуточные данные и исправляет ошибки. Одна и та же LLM может работать через терминал, набор функций, среду для редактирования кода или специализированный агентный цикл.
Обычный маршрутизатор оценивает запрос и выбирает модель. Такой подход подразумевает, что относительная сила моделей сохраняется при смене контура, но в собранных результатах лучшая модель менялась вместе с ним. Обратная зависимость тоже работала: подходящий контур определялся не только задачей, но и моделью.
HM-Router считает маршрутом конкретную пару из модели и контура. Он строит отдельные представления запроса, модели и контура, а затем складывает оценки компонентов с оценкой их совместимости. Последняя нужна для случаев, когда каждый компонент по отдельности выглядит подходящим, но вместе они работают хуже ожидаемого.
Разделение представлений решает ещё одну практическую проблему. Если команда уже проверяла модель с другими контурами, а новый контур — с другими моделями, маршрутизатор может использовать этот опыт для оценки ранее не испытанной пары. Для каждой комбинации не требуется отдельная полностью заполненная история запусков.
Совместимость оказалась важнее рейтинга компонентов
На полной оценке HM-Router показал среднюю нормализованную точность выше ближайшего обучаемого метода на 7,3 процентного пункта. Нормализованная точность здесь показывает, какую долю результата идеального маршрутизатора воспроизводит метод, если идеальный вариант заранее знает лучший маршрут для каждого запроса.
При учёте стоимости HM-Router занял первое место на всех семи проверенных бюджетах. Маршрутизатор вычитает штраф за ожидаемую стоимость из предсказанной вероятности успеха, поэтому одной обученной оценкой можно управлять разными режимами расходов.
Польза разделённых представлений сильнее проявилась при неполной истории. Когда из обучения убрали результаты для 90% маршрутов, доступ к ранее не наблюдавшимся сочетаниям поднял нормализованную точность на 15,8 пункта по сравнению с тем же маршрутизатором, ограниченным только знакомыми парами.
Проверка без оценки совместимости тоже показала разницу. Если учитывать лишь пригодность модели и контура по отдельности, точность снижалась на 5,4 пункта. Значит, рейтинг компонентов нельзя просто сложить: маршрутизатору нужно явно учить, как конкретная модель взаимодействует с конкретным агентным циклом.
Работу проверяли на 12 публичных агентных бенчмарках, которые вместе охватывали 293 маршрута, 73 модели и 25 контуров. В набор вошли задачи программирования, работы в терминале, взаимодействия с сайтами и использования инструментов; для всех методов применяли одинаковые признаки запросов от Qwen3-Embedding-8B и одинаковые результаты запусков.
Когда совместный маршрутизатор меняет архитектуру продукта
Если продукт использует одну модель и один фиксированный контур, отдельный HM-Router не добавляет нового выбора. Работа становится применимой, когда система поддерживает несколько LLM, несколько способов исполнения или регулярно добавляет новые сочетания, которые дорого прогонять по всему набору задач.
В такой архитектуре каталог маршрутов стоит хранить как пары компонентов, а не как плоский список независимых агентов. Историю запусков также полезно связывать отдельно с моделью, контуром и их сочетанием: именно такая структура позволяет переносить сведения между маршрутами.
Метод не предлагает запускать любую теоретически возможную пару. Сначала команда задаёт допустимый пул: модель должна поддерживать нужные интерфейсы, инструменты и ограничения поставщика. HM-Router ранжирует только исполнимые сочетания, включая те, для которых ещё нет прямой истории.
Практический вывод касается и тестирования. Вместо полного перебора всех сочетаний можно сначала собрать результаты для части пар, а затем направлять новые проверки туда, где общие представления модели и контура обещают полезный маршрут. Работа показывает, что такой перенос возможен на исследовательском наборе; перед внедрением его всё равно нужно обучить на собственных запросах, исходах и стоимости исполнения.
Источники
Иллюстрация: рисунок из статьи «HM-ROUTER: Joint Model and Harness Routing for Agentic Systems», Hao Mark Chen, Royson Lee, Yasuyuki Okoshi и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



