Журнал · Rit.work

HERA учит ИИ-агента останавливаться, меняя его среду и обвязку

HERA улучшает отказ от невыполнимых заданий без переобучения LLM и позволяет дешевым моделям приблизиться к более дорогим.

Rit.work
Студия разработки
7 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Агентов можно лучше научить прекращать невыполнимые задания, не переобучая саму LLM. В препринте, который не прошёл рецензирование, команда Han Luo приводит собственные замеры: HERA повысила точность отказа с 61,7% до 83,3%. Для продуктовой системы это переносит часть работы с выбора модели на устройство инструментов, проверок и логики управления агентом.

Невыполнимую задачу получают изменением среды

HERA работает с обвязкой агента — системными инструкциями, памятью, вспомогательными агентами, инструментами, проверками действий и правилами остановки. Саму языковую модель во время оптимизации не меняют.

Сначала система строит исполняемую среду вокруг структурированной базы данных и создаёт для неё набор инструментов. Независимый агент решает предложенные задания через публичный интерфейс. В работу попадают только случаи, где решение удалось выполнить и проверить, а траекторию действий можно использовать как эталон.

Затем HERA изменяет среду так, чтобы то же задание стало невыполнимым. Формулировка запроса и доступные инструменты остаются прежними, но в данных, поведении инструментов или правилах появляется препятствие. Две отдельные проверки отсеивают бессмысленные изменения и случаи, где агент всё ещё может найти обходной путь.

В примере с прогнозом погоды агент должен определить вероятность осадков. В изменённой среде нужное значение отсутствует, хотя станцию, период прогноза и остальные сведения по-прежнему можно получить. Корректное поведение здесь — собрать доступные доказательства, обнаружить критический пробел и остановиться, а не подставить догадку.

Так получаются пары с одинаковым запросом: в первой среде агент должен действовать, во второй — отказаться. hera-bench содержит 60 проверенных пар. Такая конструкция отделяет осмысленный отказ от общей склонности отвечать «не могу» на любые сложные запросы.

Ошибки меняют и обвязку, и следующий набор задач

На каждом цикле агент проходит обе задачи из пары. Модель-аналитик разбирает траектории и группирует причины ошибок: агент мог не сверить источники, пропустить зависимость между условиями, продолжить работу без разрешения или не учесть накопленные ограничения приватности.

Этот разбор запускает два процесса. Генератор сред создаёт новые задания, нацеленные на найденные слабости. Оптимизатор обвязки меняет инструкции, память, инструменты и управляющую логику, после чего кандидаты проходят отдельную проверку.

Новую версию принимают, только если она не ухудшает ни корректные отказы, ни парный успех. Парный успех означает, что агент решил выполнимый вариант и остановился на невыполнимом. Поэтому улучшение нельзя получить простым запретом на действия.

На отложенных заданиях парный успех вырос с 48,3% до 70,0%. Та же обвязка без дополнительной настройки переносилась на 19 других LLM и в среднем прибавляла 15,3 процентного пункта к точности отказа. Способность завершать выполнимые задания при этом также выросла, а не просела из-за более осторожного поведения.

Проверяли синтетические задания в контролируемых исполняемых средах, а базовой моделью при развитии обвязки служила GPT-5.6-Luna. HERA сравнивали с прямой инструкцией отказываться, оптимизацией одной обвязки и способами расширять набор задач без совместного изменения среды. Перенос между моделями проверяли на том же hera-bench, поэтому результат показывает устойчивость к смене LLM, но не заменяет испытания на инструментах и данных конкретного продукта.

Планы меняет не новая модель, а новый контур испытаний

Работа не даёт основания немедленно менять выбранную LLM. Она показывает другой рычаг: агент может стать надёжнее, если команда систематически создаёт парные сценарии, где запрос остаётся прежним, а возможность выполнить его меняется. Обычный набор успешных примеров такие ошибки не раскрывает.

Для системы с доступом к платежам, внутренним данным или внешним API стоит проверять не только долю выполненных заданий. Нужны отдельные сценарии с отсутствующими правами, противоречивыми источниками, недоступными полями и ограничениями, которые проявляются лишь после нескольких действий. В каждом случае следует оценивать и отказ, и результат на парном выполнимом варианте.

Обвязка добавляет вычислительные расходы: агент дольше собирает доказательства и проверяет условия. Однако в одном сравнении более дешёвая модель с HERA сравнялась по парному успеху с более дорогой базовой моделью при оценочной экономии API в 85%. Это делает совместную настройку среды и обвязки практической альтернативой переходу на более дорогую LLM, если основные сбои связаны с остановкой, проверкой условий и использованием инструментов.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу