Журнал · Rit.work

Маршрутизатор LLM принимает нестандартный английский за простой запрос

Длина запроса отправляет нестандартный английский к менее сильным моделям, но на проверенном наборе сам выбор уровня не дал значимого падения точности.

Rit.work
Студия разработки
17 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Одинаковые по смыслу запросы на нестандартном английском чаще отправляются к менее сильной LLM, чем версии на стандартном английском. Хотя работа не прошла рецензирование и её числа получены самим автором, на текстах изучающих язык понижение уровня происходило в 2,7 раза чаще обратного перехода. Для сервисов с каскадом моделей длину запроса нельзя считать нейтральной оценкой сложности.

Simran Koul собрал маршрутизатор, который распределял запросы между моделями для устройства, периферийного сервера и облака. Он сравнил четыре признака сложности: длину в токенах, глубину синтаксического дерева и две оценки читаемости. Смещение устойчиво возникало только по длине: нестандартные варианты чаще опускают артикли, предлоги и вспомогательные глаголы, поэтому маршрутизатор считает их более простыми.

Основная проверка охватила 37 704 пары из W&I+LOCNESS: исходное предложение человека, изучающего английский, и исправленную версию с тем же содержанием. Результат повторился на 279 вопросах Natural Questions, преобразованных в афроамериканскую и индийскую разновидности английского. Claude Opus отдельно проверял, сохранился ли смысл после преобразования.

Качество ответов проверяли на Llama 3.2 1B, Llama 3.1 8B и Claude Opus; ответ считали верным, если он содержал эталонный факт. Разрыв сохранился даже в облачном уровне: Claude Opus отвечал на индийскую разновидность английского на 11,8 процентного пункта реже, чем на стандартную. Однако дополнительное падение точности именно из-за перехода на более слабый уровень оказалось в пределах погрешности.

Вывод касается прежде всего маршрутизаторов, которые используют длину как замену сложности. Работа проверяла короткие вопросы и предложения, поэтому не показывает, насколько сам выбор более слабой модели повредит качеству на длинных и разнообразных рабочих запросах. Практическая проверка такого каскада должна включать смысловые пары с разными вариантами речи, а не только среднюю точность и стоимость.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу