Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Оценки малых языковых моделей могут сильнее зависеть от разбиения текста и формы задания, чем от знания языка. Хотя препринт не рецензирован и числа в нём получили сами авторы, Adam Zachary Wasserman и David Beauchemin показали это на французской MéTRON-FR: в тесте, созданном сразу для квебекского французского, модель дала 85,97% правильных ответов. Для отбора небольшой или узкоспециализированной модели одного рейтинга с готовым шаблоном недостаточно.
MéTRON-FR построили на архитектуре GPT-2 со 125 миллионами параметров и обучили на 92,47 миллиона французских слов. Языковую способность проверяли на минимальных парах: модель должна выбрать грамматически правильное предложение из двух почти одинаковых. Такие пары не переводили с английского, а составляли по нормам квебекского французского.
Отдельные эксперименты проверяли однотокеновую оценку, где ответ сводится к вероятности одного элемента текста. Разработчики меняли только токенизатор — правила, по которым текст делится на элементы, — сохраняя корпус, архитектуру и ход обучения. Также они сравнивали разные шаблоны ответа с подсказками-плацебо, которые не должны добавлять полезной информации.
Замена одного токенизатора воспроизвела провал одной из конфигураций, а шаблон заметно менял результат. На переведённом дополнении BLiMP модель получила 34%, то есть результат ниже случайного выбора. Этот тест нельзя напрямую сравнивать с нативным: они проверяют разные явления. Разрыв показывает другое — переведённое задание может измерять совместимость токенизатора, словаря и формы ответа вместо грамматики.
Практический вывод касается прежде всего малых моделей, других языков и тестов без дополнительного обучения. Перед выбором модели стоит повторить замер с другим токенизатором, добавить нейтральный шаблон-плацебо и использовать задания, изначально написанные на нужном языке. Работу проверяли на одной французской модели, а разброс повторных обучений в части тестов достигал примерно 5 процентных пунктов, поэтому вывод пока не переносится на все способы оценки LLM.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



