Журнал · Rit.work

North Small Translate переводит без цепочки рассуждений

Cohere вынесла основную работу в многоэтапное обучение переводчика, чтобы не тратить вычисления на рассуждения при каждом запросе.

Rit.work
Студия разработки
15 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

North Small Translate научили держать высокое качество перевода без цепочки рассуждений на каждом запросе. В препринте, который не проходил рецензирование, все числа получили сами авторы: обучение подняло среднюю оценку на WMT25 на 10,5 процентного пункта. Для сервиса перевода это меняет компромисс: вычисления уходят в подготовку модели, а рабочий запрос остаётся обычной генерацией.

Модель с открытыми весами построили на Command A+ — разреженной смеси экспертов с 25 млрд активных параметров из 218 млрд. Сначала её дообучили на готовых ответах для перевода и выполнения инструкций, затем применили DPO: модель училась предпочитать исправленный перевод собственному неудачному варианту. После этого добавили обучение с подкреплением и ещё один точечный этап DPO.

Обучающие данные отбирали по трудности, а не случайно. Ранняя версия переводила документ, модель-оценщик находила ошибки, а отдельная модель редактировала результат. Исходный и исправленный варианты образовывали пару для DPO, поэтому обучение било по ошибкам именно текущей версии, а не по отвлечённому набору плохих переводов.

Обучение с подкреплением почти не изменило среднюю оценку и ухудшило несколько языков с малым объёмом данных: модель-оценщик слабее разбирала их переводы. Финальный DPO с меньшим шагом обучения исправил эти отклонения. Для задач, где задержка менее важна, предусмотрен отдельный агентный режим: модель проверяет и редактирует собственный черновик.

Результаты проверяли на 50 языках: на наборах WMT25, WMT26 и WMT24++, длинных документах, переводе с заданным словарём и сохранении структур JSON и HTML. В основных тестах North Small Translate сравнивали с переводчиками и LLM размером менее триллиона параметров; в проверке длинного контекста её обошёл только DeepL. В работе нет замеров задержки или стоимости запроса, поэтому экономический эффект пока можно оценивать только по архитектуре инференса.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу