Журнал · Rit.work

Почему перевод инструкций ломает задачи для дообучения LLM

EuroAlpaca отделяет перевод текста от переноса самой задачи и показывает, как сохранить ограничения, форматы ответа и проверяемые инструкции на другом языке.

Rit.work
Студия разработки
7 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Прямой машинный перевод инструкционных данных может научить LLM писать на нужном языке, но хуже соблюдать ограничения задачи. В препринте Telefónica Innovación Digital и Universitat Politècnica de Catalunya, который не прошёл рецензирование и приводит числа самих авторов, такое дообучение снизило точность на 29,8% относительно исходной модели, а EuroAlpaca повысила её на 12,9%. Командам, которые готовят многоязычные данные, придётся разделять обычный перевод, сохранение отдельных полей и пересборку примера.

Почему правильный перевод даёт неправильный пример

Инструкционный пример состоит из задания, необязательных входных данных и эталонного ответа. Перевести смысл каждого поля недостаточно: задача задаётся ещё и отношениями между ними.

Предложение с намеренной грамматической ошибкой после перевода может стать правильным, и исправлять будет нечего. Требование написать ровно заданное число слов перестаёт выполняться, потому что длина фразы меняется. Рифма, анаграмма или акростих зависят от формы слов, а не только от их значения.

Другой класс ошибок возникает, когда переводчик меняет то, что должно остаться буквальным. Это код, URL, пути, идентификаторы, ключи JSON, названия меток и обязательные строки ответа. Если перевести метку класса или фрагмент программы, текст может выглядеть естественно, но автоматическая проверка отклонит результат.

EuroAlpaca начинает с 51 760 записей Alpaca Cleaned и выбирает для каждой один из трёх маршрутов. Для 54% примеров подходят переводы всех непустых полей. Примерно в четверти записей отдельные поля сохраняют без изменений, а оставшуюся пятую часть переписывают как аналогичную задачу на целевом языке.

Решение принимает Gemma-4 вместе с формальными правилами. NLLB-3.3B переводит разрешённые поля, а Gemma-4 пересобирает задания, где буквальный перенос разрушает ошибку, рифму, идиому или другое условие. Затем модель проверяет всю тройку полей: ищет противоречия, кальки, смешение языков и расхождения между инструкцией и ответом.

Сходство с эталоном скрывает поломку инструкций

Модели дообучали через LoRA отдельно для каждого языка и сравнивали с исходной версией без адаптации, обычным машинным переводом и промежуточными вариантами конвейера. Качество измеряли двумя способами: Aya Evaluation Suite сравнивает ответ с эталонным текстом, а European-IFEval проверяет формальные требования вроде длины, обязательных слов и структуры результата.

Обычный перевод улучшил ROUGE-L и F-BERT. Первая метрика ищет общие последовательности в ответе и эталоне, вторая оценивает их смысловую близость. Но на European-IFEval те же модели стали хуже выполнять проверяемые инструкции: ответ приближался к образцу, хотя нарушал условие задачи.

Локализация с сохранением задачи дала лучший результат прямого перевода во всех 200 сочетаниях модели и языка. Маршрутизация, сохранение полей и переписывание примеров прибавили 9,5 процентного пункта точности. Финальная проверка согласованности добавила ещё 3,7 пункта и одновременно улучшила показатели на Aya.

Сравнение с готовыми наборами не даёт одного победителя. EuroAlpaca обошла Okapi и MITS на общих языках, но Bactrian-X показала более высокую точность выполнения инструкций на своём пересечении. Эти наборы строили по-разному, поэтому разницу нельзя приписать только локализации.

Что менять в конвейере многоязычного дообучения

Если набор содержит только пересказ, ответы на вопросы и свободную генерацию, машинный перевод остаётся подходящим базовым маршрутом. Но единый переводчик для всего корпуса рискован, когда встречаются классификация, код, структурированный вывод, языковые упражнения и ограничения на форму ответа.

Практический конвейер должен сначала определить тип задачи и отметить защищённые фрагменты. Затем он переводит безопасные поля, сохраняет буквальные значения и создаёт новый эквивалентный пример там, где условие зависит от языка. После этого нужна проверка всей записи, а не отдельных предложений.

Оценка тоже должна разделять качество текста и соблюдение инструкции. Метрики сходства с эталоном не обнаружат переведённую метку, исчезнувшую ошибку или нарушенное число слов. Для задач с формальными условиями нужен отдельный набор проверок, которые можно выполнить программно.

Работу проверяли на четырёх небольших LLM, европейских языках и региональных вариантах с разным объёмом доступных текстов. Для каждого сочетания использовали один запуск обучения, а примеры на малоресурсных языках зависели от того, насколько хорошо Gemma-4 уже знала эти языки. Поэтому результат поддерживает изменение процесса подготовки данных, но не гарантирует тот же выигрыш для других регионов, моделей и составов корпуса.

Для продуктовой команды главный вывод относится не к выбору конкретной модели перевода. Перед массовым дообучением стоит измерить долю примеров, где ответ зависит от буквальной строки, структуры или языковой формы, и вынести их в отдельный маршрут. Иначе более естественный перевод может дать менее управляемую LLM.

Источники

Иллюстрация: рисунок из статьи «EuroAlpaca: Task-Preserving Localisation of Instruction Data for European Languages», Aleix Sant, Jordi Luque, Carlos Escolano, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу