Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Появился COILD — параллельный корпус, где исходные тексты и переводы принадлежат индийским языкам, а не проходят через английский. Консорциум индийских технических вузов дообучил на нём IndicTrans2-Distilled и NLLB-200 и улучшил перевод в большинстве проверенных направлений, хотя препринт ещё не рецензирован и все числа получили сами авторы. Для продуктов на индийском рынке это переносит часть работы с выбора модели на подготовку отраслевых данных.
Как корпус сохраняет индийский исходник
Параллельный корпус хранит пары из исходного предложения и его перевода. В COILD вошло свыше 1,16 млн таких пар для 20 сочетаний языков и восьми прикладных областей: от образования и здравоохранения до судопроизводства, сельского хозяйства и государственного управления.
Источниками стали документы, изначально написанные на индийских языках: государственные публикации, учебные материалы, газеты и книги. Для лицензированных материалов создатели получили необходимые разрешения. Тексты из сканов распознавали, затем вручную исправляли ошибки, приводили символы к единому виду и разбивали документы на предложения.
Перед переводом языковые специалисты удаляли дубликаты, незаконченные и неоднозначные фразы, персональные сведения и ошибки исходного текста. В корпус оставляли предложения, которые сохраняют смысл без соседнего абзаца. Это снижает шум при обучении, но одновременно задаёт границу ресурса: он рассчитан на перевод отдельных предложений, а не связных документов.
Переводчики работали вручную, без систем машинного перевода. Кандидатов проверяли на знание обоих языков и профессиональный опыт, а готовые пары проходили языковую и отраслевую проверку, включая согласование терминов.
Вместо английского COILD использует два опорных индийских языка. Вокруг Hindi собраны 17 пар для Indo-Aryan, Tibeto-Burman и Austro-Asiatic языков, вокруг Tamil — ещё 3 пары для Dravidian языков. Такое покрытие поддерживает перевод в обе стороны внутри каждой пары, но не образует полный набор сочетаний между всеми представленными языками.
Что показало дообучение на COILD
Для проверки создатели отделили от обучения контрольный набор из 2000 предложений. Эксперты проверили переводы, а примеры распределили по тем же восьми областям, чтобы результат не сводился к новостным или общим текстам.
На COILD дообучили две готовые многоязычные системы: IndicTrans2-Distilled, ориентированную на индийские языки, и NLLB-200 с более широким языковым охватом. Обе стали переводить лучше в большинстве направлений. Положительная разница сохранилась во всех проверенных областях, включая государственное управление, судопроизводство и научно-технические тексты.
Автоматические показатели дополнили оценкой носителей языков. Они отдельно проверяли, сохраняет ли перевод исходный смысл, насколько естественно он звучит и как выглядит его общее качество. Там, где экспертная проверка была завершена, её выводы совпали с автоматическими замерами; для Odia оценка на момент подготовки работы продолжалась.
Проверка охватывает только IndicTrans2-Distilled и NLLB-200. Создатели намеренно выбрали воспроизводимые системы машинного перевода, чтобы отделить эффект данных от возможностей модели. LLM на корпусе не тестировали, поэтому результат нельзя напрямую переносить на универсальные чат-модели или их API.
Когда COILD меняет план разработки
Работа не даёт оснований выбрать IndicTrans2-Distilled вместо NLLB-200: после дообучения улучшились обе системы. Практический вывод другой — проверенный отраслевой корпус становится отдельным рычагом качества, который не зависит от конкретной архитектуры.
Для команды, которая строит перевод государственного портала, медицинской базы или образовательного сервиса, COILD предлагает иной порядок работы. Сначала стоит определить нужные языковые пары и области, затем проверить базовую модель на отделённом контрольном наборе и только после этого дообучать её. Общий многоязычный тест не покажет, правильно ли система переводит местные административные формулы или отраслевые термины.
COILD особенно полезен там, где текущий конвейер опирается на веб-тексты или пары, полученные через английский. Он позволяет сравнить этот подход с переводами из исходных индийских документов, которые прошли ручную проверку. Результаты на двух разных моделях показывают, что эффект связан не с одной архитектурой.
Для перевода документов ресурс решает только часть задачи. Предложения в нём не проверяют связность между абзацами, восстановление пропущенных участников и выбор перевода по далёкому контексту. Поэтому COILD подходит для дообучения и проверки качества на уровне фразы, а документный контур потребует отдельного набора примеров.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



