Журнал · Rit.work

Hermes учит LLM управлять контекстами при долгом рассуждении

Hermes превращает управление несколькими контекстами из жёсткой логики оболочки в навык модели; разбираем обучение, результаты и последствия для архитектуры долгих агентов.

Rit.work
Студия разработки
1 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

LLM научили самостоятельно решать, когда открыть новый контекст для отдельной попытки, проверки или продолжения длинного решения. Хотя препринт не прошёл рецензирование и числа получили сами авторы, после Hermes-Learn точность Qwen3-4B выросла с 16,2% до 47,3%. Для команд, которые строят агентов с долгими цепочками рассуждений, управление контекстами становится отдельным навыком модели, а не только логикой управляющей оболочки.

Контекстное рассуждение управляет ходом решения

Дополнительные вычисления во время ответа помогают, только если модель умеет ими распорядиться. Когда задача не помещается в одно окно, системе приходится решать, какую работу вынести в новый контекст и какую часть уже найденного результата передать дальше. Авторы называют этот навык контекстным рассуждением.

Hermes сводит управление к двум операциям. Делегирование запускает субагента в свежем контексте: тот может независимо решить всю задачу, проверить спорный шаг, попробовать другой подход или разобрать подзадачу. Сжатие собирает накопленный прогресс в короткое резюме, после чего модель продолжает работу в новом окне без полной истории.

Управляющая оболочка может сильнее или слабее направлять модель. В самом жёстком варианте она заранее задаёт конкретную стратегию. В промежуточном — указывает только тип действия, например поиск или проверку. В наиболее свободном режиме модель сама выбирает момент, задачу для субагента и способ использовать его ответ.

Такое разделение показывает, почему длинная цепочка вызовов не равна долгому рассуждению. Модель может хорошо решать математику внутри одного окна, но бесполезно расходовать дополнительные контексты: повторять одну попытку, делегировать неподходящую подзадачу или не учитывать ответ субагента.

Hermes-Learn учит делегировать в два этапа

Сначала модель дообучают с учителем на успешных траекториях Claude Sonnet 5 и DeepSeek-V3.2. В выборку попадают решения, где корневой агент хотя бы раз делегировал работу и в итоге дал правильный ответ. Модель видит не только готовый результат, но и момент вызова субагента, формулировку его задачи и дальнейшее использование ответа.

Затем обучение с подкреплением оставляет модели больше свободы. Награда бинарная: правильный финальный ответ приносит единицу, неправильный — ноль. Учебная программа сначала показывает режимы с более явными подсказками оболочки, а затем ослабляет управление, чтобы модель сама выбирала стратегию.

Обучают только действия корневого агента. Субагенты работают на глубине одного перехода, а умение составлять сжатое резюме отдельно не оптимизируют: работа сосредоточена на делегировании. Поэтому Hermes-Learn пока следует рассматривать как способ научить модель распределять задачи, а не как полную программу обучения всех частей многоагентной системы.

Проверка охватывает Qwen3-4B, Olmo-3-7B и более способные модели на AIME, HMMT, BeyondAIME, IMO-AnswerBench и FrontierScience. Один контекст ограничивали 8 тысячами токенов, а стандартная конфигурация Hermes могла распределить до 56 тысяч токенов между агентами. Модели сравнивали с обычным решением внутри одного окна и с разными уровнями управления со стороны оболочки.

Дополнительные контексты придётся учитывать в обучении

Способные модели использовали Hermes без специальной подготовки. У Claude Sonnet 5 средняя точность на объединённом математическом наборе выросла с 55,3% при работе в одном окне до 76,7% в свободном режиме Hermes. Базовые компактные модели, напротив, сначала тратили дополнительные контексты во вред результату.

Эффект перенёсся на другую архитектуру: у Olmo-3-7B точность с Hermes выросла с 4,8% до 40,6% после двух этапов обучения, тогда как качество внутри одного окна осталось почти прежним. Значит, прибавка связана не с новым математическим знанием, а с тем, как модель организует вычисления между окнами.

Обученный навык сохранился и при конфигурациях, которых модель не видела во время подготовки. Когда авторам разрешили более глубокое рекурсивное делегирование, Qwen3-4B достиг 55,6%. Hermes-Learn также сочетался с другими способами масштабировать вычисления во время ответа, включая Recursive Self-Aggregation и DeepSeekMath Agent.

Для архитектуры продукта вывод зависит от выбранной модели. Если система работает через API способной модели, можно сначала вынести поиск, проверку и сжатие истории в простую оболочку и проверить, умеет ли модель сама выбирать между ними. Для небольшой открытой модели добавление параллельных агентов без обучения рискованно: больший бюджет контекста сам по себе не гарантирует прироста.

Команде, которая обучает собственную модель, стоит сохранять успешные траектории работы с инструментами и оценивать не только финальный ответ, но и решения о делегировании. Hermes показывает практичную последовательность: сначала продемонстрировать стратегии под управлением оболочки, затем постепенно передать выбор модели. Работа подтверждает этот подход прежде всего на математических и научных задачах с длинным рассуждением.

Источники

Иллюстрация: рисунок из статьи «Hermes: Learning Contextual Reasoning Unlocks Test-Time Scaling», Xinyu Li, Mononito Goswami, Hao Liu и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу