Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Малые языковые модели (SLM) заставили соблюдать план и вызывать нужные инструменты на устройстве без дообучения. В работе Minghui Yu, Ke Mu и Gang Wu средняя итоговая оценка выросла на 1,21 балла; препринт не прошёл рецензирование, и все числа получили сами авторы. Метод подходит для локальных агентов, которым недоступна облачная модель и не хватает памяти для крупной.
Декодер разрешает модели выбирать параметры, но не инструмент
Авторы решали задачу спутникового агента на NVIDIA Jetson Orin NX. Другие программы обработки снимков оставляли языковой модели менее 4 ГБ памяти, поэтому агенту приходилось работать локально и без обращения к облаку.
Обычная инструкция в системном запросе не обеспечивала нужного порядка действий. Некоторые модели игнорировали требование сначала составить план, а затем выбирали неверный инструмент, повторяли шаги или завершали задачу раньше времени.
PTC-Decoder переносит контроль из запроса в генерацию ответа. На первом ходе модель обязана вызвать инструмент plan. Он превращает пользовательскую задачу в последовательность атомарных инструментов, которую исполнитель хранит и проходит по шагам.
На следующих ходах TC-Decoder принудительно подставляет имя очередного инструмента. Для этого конечный автомат отслеживает, какую часть служебной конструкции модель уже выдала, и маскирует все недопустимые токены. Когда имя инструмента закончено, ограничения снимаются.
Параметры вызова модель генерирует сама. Например, декодер может обязать её выбрать инструмент анализа растительности, но не задаёт область съёмки, период или другие аргументы. Так система фиксирует структуру процесса, не пытаясь заранее описать каждый допустимый запрос.
Подход не требует обучающего набора, дообучения или изменений весов. Однако он требует доступа к декодеру модели: при использовании закрытого API, который не позволяет управлять допустимыми токенами, встроить такой механизм на стороне приложения не получится.
Жёсткий выбор инструмента дал основной прирост
Метод проверяли на 200 реальных задачах дистанционного зондирования и семи моделях размером до 2B параметров. Задания выполнялись на Jetson вместе с другими процессами, а каждый запускали однократно. Результаты сравнивали с обычным агентом и вариантом, где план добавили, но не ограничивали последующие вызовы.
Качество оценивали двумя способами. Модель-оценщик DeepSeek-V4-flash проверяла итог, ход выполнения и устойчивость, а программные метрики сравнивали вызванные инструменты с эталонной последовательностью. Люди дополнительно проверили часть оценок.
PTC-Decoder улучшил итоговую оценку у всех испытанных моделей, а максимальная F1-мера для последовательности инструментов достигла 0,359. F1-мера объединяет полноту нужных вызовов и долю вызовов без лишних инструментов. Вариант со свободным исполнением плана давал смешанные результаты: одна модель после планирования сразу считала все задания завершёнными.
Удаление TC-Decoder ухудшило метрики, но почти не сократило вычислительную работу. Это показывает, что результат обеспечил не сам дополнительный этап планирования, а принудительное соблюдение выбранной последовательности.
Направление эффекта сохранилось на ToolAlpaca, Seal-Tools и API-Bank. При этом проверка охватывает агентов с фиксированным набором инструментов и небольшие локальные модели; работу с открытыми действиями или крупными облачными моделями эксперимент не моделирует.
Командам стоит отделить надёжность шага от качества ответа
PTC-Decoder меняет планы команд, которые строят автономного агента на слабой локальной модели и заранее знают допустимый процесс. Для такого продукта жёсткое управление декодированием стоит проверить до сбора данных для дообучения: оно может закрыть ошибки выбора инструмента без изменения модели.
Метод не делает агента надёжным целиком. Лучшая точность результата составила 2,81/5, а прирост устойчивости оказался меньше прироста качества последовательности. Декодер гарантирует имя инструмента, но модель всё ещё может передать неверные аргументы, неправильно понять результат или не восстановиться после ошибки.
Расход токенов относительно обычного агента вырос в 2,07 раза. Почти весь этот рост связан с планом и дополнительным контекстом, а не с автоматом, поэтому отсутствие дообучения не означает бесплатный запуск. На устройстве с жёсткими лимитами памяти, времени или энергии это нужно включить в нагрузочные испытания.
Ограничение полезнее для слабых моделей: у одной из более способных моделей свободное выполнение плана дало лучшую F1-меру. Практический выбор поэтому не сводится к включению PTC-Decoder для всех запросов. Команде нужен отдельный тест для каждой модели и класса задач, а ограничения можно активировать только там, где цена пропущенного шага выше цены лишнего вызова.
Архитектурно работа предлагает узкий слой контроля между планировщиком и моделью. Он не заменяет проверку аргументов, обработку ошибок и контроль итогового ответа, но позволяет не поручать слабой модели ту часть процесса, которую система уже знает заранее.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



