Журнал · Rit.work

ToolCompass учит агентов выбирать полезные пробы инструментов

ToolCompass связывает инструменты по функции и помогает агенту осваивать незнакомые API без эталонных цепочек вызовов и дополнительных вычислений при работе.

Rit.work
Студия разработки
23 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Агентов научили пробовать незнакомые инструменты выборочно: сохранять полезные попытки и отсекать вызовы функций, не связанных с задачей. В работе Junlin Fang и коллег, которая не прошла рецензирование и содержит их собственные замеры, ToolCompass поднял долю успешных OOD-задач AppWorld с 61,15% до 70,02% на Qwen3.5-9B. Для продукта с меняющимся набором API это схема пост-обучения без дополнительных вычислений при работе агента.

Обычное обучение по итоговому результату одинаково оценивает все шаги успешной цепочки, включая бесполезные вызовы. ToolCompass добавляет другую подсказку: инструменты из разных приложений должны иметь близкие внутренние представления, если выполняют одну функцию, например поиск. Вызовы с разными функциями, наоборот, разводятся дальше друг от друга.

Для обучения нужны только классы функций уже известных инструментов. Эталонные последовательности вызовов и доступ к будущим инструментам не требуются. Вспомогательный модуль и прототипы функций после пост-обучения удаляют, поэтому архитектура и стоимость работы агента не меняются.

На OOD-задачах AppWorld среднее число бесполезных проб снизилось примерно втрое: с 12,75 до 4,07 на задачу. При этом метод не запрещает исследование незнакомых API целиком: агент чаще выбирает функции, которые связаны с целью, и реже исчерпывает лимит взаимодействий на повторах и посторонних вызовах.

Метод проверяли с Qwen3.5-4B и Qwen3.5-9B на AppWorld и FTRL, добавляя его к GRPO, RFT и DMPO. На AppWorld задача считалась решённой, только если агент проходил все её проверки; метрика FTRL учитывала точность вызовов инструментов и долю завершённых задач. ToolCompass улучшил все приведённые результаты для известных и отложенных инструментов, но выводы пока относятся к этим моделям, средам и схеме разметки функций.

Источники

Иллюстрация: рисунок из статьи «Toolcompass: Guiding Tool Trialing, Not Suppressing It», Junlin Fang, Chong Zhang, Do Nguyen-Thanh и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу