Журнал · Rit.work

RareTrap оценивает редкие сбои LLM через API

Метод превращает поиск чрезмерно длинных и зацикленных ответов в вероятностную оценку, но измеряет риск на заданном наборе синтетических запросов, а не в реальном трафике.

Rit.work
Студия разработки
30 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Вероятность редких сбоев LLM научились оценивать без доступа к весам и внутренним состояниям модели. В отдельных конфигурациях RareTrap хватило 200 обращений к модели — это замеры авторов из ещё не рецензированного препринта. Такой тест дополняет найденные примеры отказов числом, по которому можно сравнивать модели и их версии.

RareTrap сначала задаёт воспроизводимое распределение синтетических запросов. Вспомогательная LLM переводит точки из пространства случайных значений в последовательности токенов с учётом геометрии их векторных представлений. Затем последовательный метод Монте-Карло оставляет запросы с более тяжёлыми последствиями и постепенно смещает выборку к редким сбоям, сохраняя возможность оценить их вероятность в исходном распределении.

Целевой модели передают только запрос и получают ответ. RareTrap не нужны градиенты, вероятности токенов, параметры или скрытые состояния, поэтому он работает и с моделями, доступными лишь через API. В проверенных конфигурациях оценки совпали с результатами прямой случайной выборки в пределах погрешности.

Метод испытали на 12 моделях, включая GPT-5.4 и Claude Sonnet 4.6. Проверяли два вида затратного поведения: чрезмерно длинную генерацию и вырожденное повторение фрагментов. Например, у Nemotron-9B последовательный отбор поднял медианную длину ответа примерно с 400 токенов до установленного предела в 20 003 токена. Это показывает, что процедура концентрируется на проблемной области, а не случайно находит один необычный ответ.

Полученная вероятность относится только к распределению запросов, которое создала выбранная вспомогательная модель. Это не оценка частоты сбоя в реальном трафике. Для проверки перед запуском RareTrap полезен как фиксированный стресс-тест: команда задаёт одну меру тяжести и одно распределение, сравнивает кандидатов, а найденные запросы сохраняет для регрессионных тестов после дообучения или смены модели.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу