Журнал · Rit.work

Токенизатор и шаблон искажают оценки малых языковых моделей

Эксперимент с французской MéTRON-FR показал, что однотокеновые тесты малых моделей могут измерять совместимость с токенизатором и шаблоном, а не знание языка.

Rit.work
Студия разработки
16 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Оценки малых языковых моделей могут сильнее зависеть от разбиения текста и формы задания, чем от знания языка. Хотя препринт не рецензирован и числа в нём получили сами авторы, Adam Zachary Wasserman и David Beauchemin показали это на французской MéTRON-FR: в тесте, созданном сразу для квебекского французского, модель дала 85,97% правильных ответов. Для отбора небольшой или узкоспециализированной модели одного рейтинга с готовым шаблоном недостаточно.

MéTRON-FR построили на архитектуре GPT-2 со 125 миллионами параметров и обучили на 92,47 миллиона французских слов. Языковую способность проверяли на минимальных парах: модель должна выбрать грамматически правильное предложение из двух почти одинаковых. Такие пары не переводили с английского, а составляли по нормам квебекского французского.

Отдельные эксперименты проверяли однотокеновую оценку, где ответ сводится к вероятности одного элемента текста. Разработчики меняли только токенизатор — правила, по которым текст делится на элементы, — сохраняя корпус, архитектуру и ход обучения. Также они сравнивали разные шаблоны ответа с подсказками-плацебо, которые не должны добавлять полезной информации.

Замена одного токенизатора воспроизвела провал одной из конфигураций, а шаблон заметно менял результат. На переведённом дополнении BLiMP модель получила 34%, то есть результат ниже случайного выбора. Этот тест нельзя напрямую сравнивать с нативным: они проверяют разные явления. Разрыв показывает другое — переведённое задание может измерять совместимость токенизатора, словаря и формы ответа вместо грамматики.

Практический вывод касается прежде всего малых моделей, других языков и тестов без дополнительного обучения. Перед выбором модели стоит повторить замер с другим токенизатором, добавить нейтральный шаблон-плацебо и использовать задания, изначально написанные на нужном языке. Работу проверяли на одной французской модели, а разброс повторных обучений в части тестов достигал примерно 5 процентных пунктов, поэтому вывод пока не переносится на все способы оценки LLM.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу