Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Готовые малые языковые модели не смогли надёжно заменить простые алгоритмы в служебных задачах ИИ-агента. В препринте PayPal AI, который не рецензирован и где все числа получили сами авторы, ни одна из 16 конфигураций не прошла заданный порог качества. Для рабочего продукта из этого следует не отказ от малых моделей, а другая архитектура: сначала простой алгоритм, затем модель только для спорных случаев.
Порог пригодности привязан к рабочей альтернативе
Исследование проверяет не абстрактное качество модели, а её пригодность для конкретной точки в управляющем контуре агента. Порог задают через алгоритм, который можно развернуть без языковой модели: правило безопасности, поиск BM25, эвристику записи в память или подбор инструмента по совпадению терминов.
Модель проходит проверку, только если с учётом статистической погрешности превосходит этот алгоритм. Одного удачного среднего результата недостаточно: нижняя граница доверительного интервала должна оказаться выше порога. Для проверки безопасности действует обратное правило — верхняя граница доли опасных разрешений должна оставаться ниже допустимого уровня.
Такой подход защищает от замены дешёвого и предсказуемого компонента на модель, которая лучше лишь на конкретной выборке. До запуска эксперимента фиксируют тестовые данные, подсказку, метрику и порог. После этого нельзя подбирать формулировку под модель или считать прохождением случайное превышение порога.
Проверка охватывала четыре задачи: автоматическое разрешение команд оболочки, поиск нужных фактов в памяти, решение о записи нового факта и выбор инструмента. Основную серию провели на линейке Qwen3 вплоть до 8B, затем вывод проверили на Llama-3.x. Подсказки не настраивали под отдельные модели, поэтому работа измеряет готовность стандартной модели к существующему контуру, а не предел после дообучения и переработки подсказок.
Вероятности отделяют нехватку способности от ошибки порога
Ответ, который модель выбрала при жадном декодировании, не показывает, различает ли она классы внутри. Модель может правильно ранжировать безопасные и опасные команды, но использовать неудачную границу между «разрешить» и «передать человеку».
Для диагностики работа сравнивает логарифмы вероятностей двух вариантов ответа. Затем порог сдвигают и смотрят, сохраняется ли разделение классов. Если сигнал отсутствует при любом пороге, модели не хватает способности. Если классы разделяются, но готовый ответ неверен, проблему можно исправить настройкой границы решения.
На выборе инструмента сигнал для отказа от вызова оказался сильным: площадь под ROC-кривой составила от 0,942 до 0,980. Эта метрика показывает, насколько уверенно сигнал ранжирует два класса независимо от конкретного порога. Значит, частые лишние вызовы здесь связаны прежде всего с декодированием, а не с отсутствием нужного знания.
В задаче записи в память даже лучший порог не выводил модель за требуемую границу. Здесь калибровки недостаточно: нужна модель большей ёмкости или обучение под задачу. Для поиска по длинной истории проявилась третья причина — модель понимала релевантность, но хуже ранжировала весь контекст сразу.
В итоге диагностика задаёт порядок действий. Сначала проверяют, есть ли полезный сигнал во внутренних вероятностях. Если есть — на калибровочной выборке настраивают порог и один раз проверяют его на тесте. Если сигнала нет, смена температуры или формата ответа не поможет: потребуется другая модель либо другая схема обработки.
Планы меняет каскад, а не выбор ещё одной модели
Для поиска в памяти рабочей оказалась двухступенчатая схема. BM25 сначала отбирал двадцать наиболее подходящих фрагментов, после чего Qwen3-4B меняла их порядок. Такой вариант превзошёл самостоятельный BM25 на 0,047 по доле релевантных записей в первой пятёрке, хотя доверительный интервал всё ещё не позволил признать конфигурацию полностью пригодной по исходному правилу.
В выборе инструментов действует тот же принцип. Поиск по терминам может закрывать очевидные случаи, а модель — строить аргументы вызова, решать, нужно ли воздержаться, и разбирать каталоги с похожими инструментами. Модель не заменяет базовый алгоритм целиком, а получает участок, где способна добавить измеримую пользу.
Квантизация до 4 бит этот вывод не изменила. На крупных вариантах Qwen3 она почти сохраняла диагностический сигнал, на младших вред зависел от задачи и способа квантизации, но ни одна конфигурация не перешла порог пригодности. Сжимать модель имеет смысл после проверки качества, а не в надежде исправить её решения.
Для продуктовой команды процедура выглядит так: определить текущую дешёвую альтернативу, привязать к ней порог, проверить доверительную границу и затем разобрать вероятности ошибочных ответов. Только после этого стоит выбирать между настройкой порога, увеличением модели и каскадом. Работа не измеряет задержку, энергопотребление и стоимость инфраструктуры, поэтому итоговое решение о развёртывании потребует отдельного системного теста.
Границы вывода заданы одним контуром агента и четырьмя типами микрозадач. Переносится прежде всего сам способ проверки: модель должна выигрывать у доступной альтернативы на заранее зафиксированном тесте. Конкретные пороги и величины выигрыша придётся пересчитать на данных продукта.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



