Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Небольшую мультиязычную модель научили вести промежуточное рассуждение на языке запроса, даже если для части языков ей не показывали таких примеров. Mehrnaz Mofakhami и коллеги получили долю таких цепочек выше 93%. Поскольку препринт не прошёл рецензирование, а все числа посчитали сами авторы, результат стоит считать ориентиром: мультиязычному продукту может понадобиться не отдельный корпус рассуждений для каждого рынка, а правильно собранная общая смесь.
Три вида данных учат разным частям поведения
За основу взяли Tiny Aya Base на 3,35 млрд параметров. При постобучении с учителем (SFT) модель получает готовые запросы, промежуточные цепочки и ответы, а затем учится воспроизводить такую структуру.
Первый компонент смеси — английские задачи с подробными рассуждениями. Они дают основную способность решать математику, научные и общие задачи. В базовом варианте этот корпус содержал около 1,7 млн примеров; для итоговой модели к нему добавили более длинные цепочки из других наборов.
Второй компонент — английские цепочки, автоматически переведённые на 44 языка. Для большинства экспериментов объём ограничивали примерно 5 тыс. примеров на язык. Перед переводом убирали запросы с переключением между языками, требованиями к точному числу слов и заданиями, где сам текст обсуждает перевод: такие примеры легко ломают логику цепочки.
Третий компонент не содержит рассуждений вообще. Это обычные мультиязычные пары из инструкции и ответа, где блок промежуточной цепочки оставлен пустым. Такие данные дешевле длинных переведённых рассуждений и помогают модели связать язык запроса с языком ответа, не ослабляя её способность отвечать напрямую.
Все три вида примеров смешивали в учебных партиях. Модель одновременно училась решать сложные задачи по-английски, переносить форму рассуждения на другие языки и следовать обычным инструкциям. Эта одновременность оказалась важнее, чем дообучать навыки по очереди.
Широкая смесь переносит язык рассуждения на новые языки
Главная метрика показывает, как часто язык промежуточной цепочки совпадает с языком запроса. Её считали автоматически и отдельно проверяли качество решения, чтобы модель не получала высокий результат простым переводом слабого рассуждения.
Итоговую модель оценили на шести наборах задач для 60 языков. Проверка включала математику, здравый смысл, следование инструкциям, открытые ответы и вопросы с культурным контекстом. Более широкое языковое покрытие не ухудшило результаты на языках из обучения и повысило долю рассуждений на нужном языке для тех, которые модель при постобучении не видела.
Обычные мультиязычные инструкции также улучшили перенос на невиданные языки. Однако заменить ими английский корпус рассуждений нельзя: без достаточно сильной английской основы модель хуже справлялась со сложной математикой. Работа разделяет два навыка — способность решить задачу и выбор языка, на котором модель строит путь к ответу.
Общая модель оказалась надёжнее региональных специалистов. Когда отдельно обученные варианты усредняли по весам, их языковые настройки взаимно уничтожались и промежуточные цепочки снова переходили преимущественно на английский. Последовательное дообучение тоже давало менее устойчивый баланс, тогда как совместное смешивание ни в одном сравнении не уступило одновременно по качеству задач и языку рассуждения.
Проверка относится к одной компактной архитектуре и использует автоматически переведённые цепочки. Люди не оценивали естественность, связность и культурную уместность рассуждений. Кроме того, перед запросом модели явно указывали думать на том же языке — без этой подсказки, при смешанных языках или другом системном запросе результат может измениться.
Когда работа меняет план мультиязычного продукта
Команде, которая постобучает модель с доступными весами, не обязательно начинать с производства большого корпуса рассуждений для каждой страны. Практичнее сохранить сильный общий корпус сложных задач, перевести небольшой отфильтрованный набор цепочек на разнообразные языки и добавить более доступные локальные инструкции без промежуточных шагов.
Разделять модель по регионам тоже не выглядит хорошим первым решением. Совместное обучение помогает переносить языковое поведение за пределы учебного списка, а слияние отдельных специалистов может вернуть английский язык даже при сохранении точности ответов. Один общий цикл постобучения стоит проверить раньше, чем несколько локальных веток.
Экономия на разметке не отменяет продуктовую проверку. Для целевых рынков нужно оценивать не только совпадение языка, но и естественность формулировок, сохранение терминов и правильность рассуждения в конкретном домене. Отдельно следует воспроизвести рабочий системный запрос: результат статьи зависит от явной команды рассуждать на языке пользователя.
Веса модели и обучающие данные выпущены вместе с работой, поэтому подход можно воспроизвести как прототип. Его главный практический вывод относится не к выбору новой архитектуры, а к распределению бюджета на данные: сначала широкая смесь и общий английский фундамент, затем точечная проверка языков, где ошибки действительно влияют на продукт.
Источники
- Building Multilingual Bridges: Data Mixing as the Pillar of Generalization for In-Language Reasoning
Иллюстрация: рисунок из статьи «Building Multilingual Bridges: Data Mixing as the Pillar of Generalization for In-Language Reasoning», Mehrnaz Mofakhami, Ananya Sahu, Alejandro R. Salamanca и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



