Журнал · Rit.work

EDGE собирает данные для агентов на живых API

LG CNS предложила проверять цепочки вызовов на живых API и превращать успешные выполнения в данные, которые подтягивают малые открытые модели к более крупным.

Rit.work
Студия разработки
7 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Малую открытую модель научили надёжнее выполнять цепочки зависимых вызовов к живым API. В препринте LG CNS, который не проходил рецензирование и приводит замеры самих авторов, дообученная Qwen3.5-9B почти сравнялась с исходной Qwen3.5-27B. Для команд с локальными LLM это меняет подход к данным: рабочие примеры можно собирать из собственной системы инструментов, а не искать готовый корпус с похожими сценариями.

Связь между инструментами проверяет само API

Обычный синтез данных начинает со схем функций и предположений модели. Если поле на выходе одного инструмента похоже на параметр другого, модель считает их совместимыми и строит цепочку. Совпадение названий и типов ещё не означает, что второй вызов примет значение и вернёт полезный результат.

EDGE сначала строит граф зависимостей: инструменты становятся его узлами, а возможные передачи значений — связями. Кандидатов предлагает LLM по описаниям и схемам функций, после чего система выполняет вызовы на настоящих конечных точках API. Связь сохраняется, если переданное значение работает, и постепенно удаляется, если вызовы завершаются структурной ошибкой.

Случайный сбой сервера учитывается слабее, чем неверная привязка параметра. Это не даёт удалить корректную связь из-за временной недоступности сервиса. Система также продолжает иногда проверять малоизученные варианты, а не проходит только по уже успешным маршрутам.

Отдельная часть метода отвечает за результаты с множеством записей. Одно значение передают следующему инструменту напрямую, небольшой набор разворачивают в несколько вызовов, а крупный сначала сокращают по явному правилу: например, выбирают минимум, максимум или значения по условию. Так обучающий пример не теряет страницы ответа и не подставляет в следующий вызов случайную запись.

Из проверенных маршрутов EDGE составляет запросы на корейском языке, ответы и последовательности вызовов. В корпус вошёл 1 781 такой пример. Для проверки метода авторы создали KOPA-Bench: 145 задач на живых API из 10 государственных платформ и шести областей, включая транспорт, финансы, образование и право. Перенос навыка за пределы этих сервисов дополнительно проверяли на BFCL.

Корпус дал малым Qwen большую часть прироста

После обучения Qwen3.5-4B прибавила 13 процентных пунктов по доле задач, решённых с первой попытки. Qwen3.5-9B прибавила 10 пунктов. Разница с исходными моделями статистически значима.

Дообученная Qwen3.5-9B решила с первой попытки 43% задач, а исходная Qwen3.5-27B — 45%. Меньшая модель не обошла крупную, но приблизилась к ней при втрое меньшем числе параметров. На BFCL направление эффекта сохранилось, хотя корпус собирали на корейских государственных API.

Контрольный опыт отделяет пользу данных от пользы GRPO — обучения с подкреплением по проверяемому результату. Обычное обучение на готовых правильных примерах из того же корпуса уже добавило Qwen3.5-4B 9,7 процентного пункта. Значит, основной эффект даёт не только способ дообучения, но и сами исполнимые цепочки.

Когда EDGE стоит включить в план разработки

Работа не предлагает новую архитектуру агента и не требует менять прикладной код на отдельную платформу. Она показывает, как превратить реестр инструментов и доступ к тестовой среде в специализированный обучающий корпус. Такой этап имеет смысл планировать до тонкой настройки модели, если агент пропускает обязательные справочные вызовы или отвечает по первой части большого результата.

Практический конвейер стоит строить вокруг выполнения, а не вокруг проверки схем. Сначала система предлагает возможные передачи полей, затем запускает их в изолированной среде, разделяет ошибки связей и временные сбои, сохраняет успешные трассы и только после этого пишет по ним пользовательские запросы.

Нужно также заранее определить правила для больших ответов. Ограниченный параллельный обход, фильтрация и детерминированный выбор значений должны входить в описание задачи. Иначе синтетическая трасса может формально вызывать правильные функции, но обучать модель отвечать по неполному набору данных.

Проверять следует не только совпадение вызовов с эталоном. KOPA-Bench отдельно оценивает итоговый ответ, состояние сервера и выполненные действия: другой маршрут может привести к верному результату, а присутствие нужного вызова ещё не гарантирует правильное состояние системы.

Переносить заявленный эффект напрямую на частные API и другие языки рано: эксперименты охватывают корейские государственные сервисы, а живые конечные точки могут менять схемы, доступность и содержимое ответов. EDGE также не сравнивали целиком с другими системами синтеза; опыты изолируют пользу проверки выполнением внутри собственного конвейера.

Источники

Иллюстрация: рисунок из статьи «Multi-Step Tool-Calling over Korean Open Public APIs: A Benchmark and a Data-Synthesis Recipe», Dain Kim, Eungi Cho, Kyumin Kim и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу