Журнал · Rit.work

Сбой подскажет, где улучшать LLM-агента

Разбор ошибок помогает выбрать между доработкой обвязки LLM-агента и дообучением модели на его успешных траекториях.

Rit.work
Студия разработки
9 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Для LLM-агентов нашли практическое правило, которое помогает выбрать между доработкой обвязки и обучением модели. В препринте Yuan Tian и соавторов, который не прошёл рецензирование и содержит замеры самих авторов, новая обвязка подняла оценку Qwen3.5-4B на DeepPlanning с 0,16 до 0,30. Из результатов следует простой порядок: сначала устранять сбои процесса, затем переносить устойчивое поведение в веса и доучивать модель на содержательных ошибках.

Обвязка — это код и инструкции вокруг замороженной модели: системные запросы, память, контрольные точки, ограничения и доступные инструменты. Автоматический цикл предлагал изменения этой системы и проверял их на задачах. Ошибочные траектории разделяли по первому сигналу: заблокированные вызовы, циклы и исчерпанный бюджет шагов считали сбоями процесса, а доставленный, но плохой план — ошибкой содержания.

Обвязка сокращала циклы и помогала агенту чаще завершать план, но не исправляла его качество после успешной доставки. Адаптеры LoRA, то есть небольшие обучаемые добавки к весам, получили траектории улучшенного агента и под исходной обвязкой прибавили 0,13 к оценке у обоих размеров модели. Для Qwen3.5-9B адаптер без новой обвязки сравнялся с полной линией её улучшения, а для Qwen3.5-4B два подхода усиливали друг друга.

Перенос в веса работает не для каждого изменения. На WebArena-Lite выигрыш появился потому, что агент видел две страницы истории вместо одной; обучение на этих траекториях ничего не добавило. Значит, поведение модели можно закреплять дообучением, а сведения, которые доступны только во время выполнения, должны остаться в обвязке.

Основные опыты провели на DeepPlanning с Qwen3.5-4B и Qwen3.5-9B: решения принимали на 48 задачах, итог проверяли ещё на 72. Авторы сравнивали исходную и улучшенную обвязку с базовыми и дообученными весами; перенос подхода отдельно проверили на WebArena-Lite. Правило применимо там, где система записывает траектории агента и может автоматически оценить результат задачи.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу