Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Новая система WEFT позволяет масштабировать дообучение ИИ-агентов работе с внешними инструментами, не сводя задачу к созданию новых исполняемых окружений. В нерецензированном препринте, где все числа получили сами авторы, система обошла сопоставимый по размеру базовый подход на каждом из трёх тестов. Для команд это переносит узкое место с объёма учебных сред на согласованность всей системы, которая ставит задачу, запускает агента и проверяет результат.
Почему одного окружения недостаточно
Дообучение работе с инструментами учит уже подготовленную модель вызывать API, выполнять последовательности действий и учитывать изменения во внешней системе. Для этого часто создают исполняемые окружения: песочницы, сервисы и наборы доступных операций, с которыми взаимодействует агент.
WEFT рассматривает окружение лишь как одну часть учебной системы. Кроме него нужны задача, управляющая обвязка агента и модуль, который оценивает результат. Если эти части расходятся, дополнительное окружение не обязательно даёт полезный обучающий сигнал.
Например, задача может требовать состояния, которое окружение хранит иначе, чем ожидает проверяющий модуль. Агент тогда выполняет разумные действия, но получает отрицательную оценку. Возможна и обратная ситуация: проверка засчитывает формально верный ответ, хотя нужное изменение во внешнем сервисе не произошло.
Поэтому WEFT масштабирует систему сразу по трём направлениям: расширяет набор окружений, усложняет задачи и делает взаимодействия разнообразнее. Единицей масштабирования становится не отдельная песочница, а связка из условий задачи, доступных инструментов, правил запуска и проверки.
Как WEFT находит сбой и сохраняет верные шаги
Система использует трассы выполнения и сведения о состоянии, чтобы определить, какая часть связки привела к ошибке. Затем она исправляет ответственный компонент и запускает свежие прогоны. Их результаты служат основанием для следующего цикла изменений.
Такой подход отделяет ошибку модели от дефекта учебной инфраструктуры. Если неверно работает проверка или окружение возвращает несогласованное состояние, система должна исправить их, а не обучать модель под ошибочный сигнал.
Для длинных последовательностей WEFT сохраняет уже проверенную часть пути. Новая попытка продолжает работу после успешных шагов, а не разыгрывает весь сценарий заново. Это сокращает число повторов и не позволяет случайной неудаче в конце обесценить весь пройденный путь.
Обучающий сигнал также привязывается к отдельному ходу агента. Модель получает более точное указание, какое действие помогло или помешало выполнить задачу, вместо одной оценки за длинную цепочку вызовов.
За параллельные прогоны отвечает MegaMCP. Он изолирует состояние разных запусков и позволяет его восстановить, хотя агенты используют общие сервисы инструментов. Без такой изоляции один прогон может изменить данные, от которых зависит другой, и результаты перестанут воспроизводиться.
На BFCL V4, τ²-Bench и Claw-Eval модель WEFT-14B опередила Agent-World-14B на 6,41, 2,23 и 12,27 процентного пункта соответственно. Разный разрыв показывает, что эффект зависит от типа задания, но преимущество сохранилось на всех перечисленных тестах.
Когда команде придётся пересмотреть конвейер обучения
Работа меняет планы команд, которые собирались наращивать качество агента главным образом за счёт новых песочниц и синтетических задач. WEFT предлагает сначала проверить, образуют ли окружение, условие, запуск и оценка одну согласованную систему. Иначе рост объёма данных масштабирует шум вместе с полезными примерами.
Практическое следствие — трассы выполнения и снимки состояния становятся частью учебных данных. Они нужны не только для отладки: по ним система связывает сбой с конкретным компонентом, сохраняет подтверждённый прогресс и решает, откуда продолжить следующий прогон.
При параллельном обучении придётся отдельно проектировать изоляцию и восстановление состояния. Это особенно существенно, если множество агентов одновременно обращаются к одному сервису, меняют общие сущности или выполняют длинные процессы. Обычного журнала вызовов здесь недостаточно: система должна знать, какое состояние принадлежало каждому запуску.
Проверка охватывает WEFT-8B, WEFT-14B и WEFT-35B-A3B, несколько тестов на использование инструментов и более длинные процессы из Toolathlon-Verified и AutomationBench; сравнение для моделей сопоставимого размера проведено с подходами, которые масштабируют прежде всего окружения. Поскольку полный текст недоступен и материал подготовлен по абстракту, точную процедуру построения задач и обновления компонентов восстановить нельзя.
Поэтому WEFT пока даёт архитектурное направление, а не готовый рецепт миграции. Командам, которые обучают собственных агентов, стоит считать контур проверки, управление состоянием и управляющую обвязку такими же частями обучающего продукта, как модель и набор окружений.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



