Журнал · Rit.work

QGLAS сокращает ответы LLM, не меняя сигнал качества

QGLAS отделяет качество ответа от требования краткости и сокращает генерацию LLM, не позволяя длине развернуть обучающий сигнал.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Языковую модель научили сокращать ответы при обучении с подкреплением (RL), не позволяя требованию краткости менять решение о том, какой ответ стоит поощрять. В нерецензированном препринте все числа получили сами авторы: при сокращении примерно на 30% метод QGLAS сохранил 98,4–102% прироста качества от обучения без контроля длины. Для команд, которые дообучают LLM на открытых задачах, это предлагает более безопасную замену штрафу за длинный ответ.

Почему штраф за длину может поощрить худший ответ

В задачах с проверяемым результатом граница обычно ясна: решение верно или неверно, поэтому среди верных вариантов можно предпочесть короткий. В диалоге, письме или следовании инструкции такой границы нет. Модель-оценщик выставляет плавные оценки, а дополнительное объяснение может быть как полезной деталью, так и пустым многословием.

Групповые алгоритмы RL сравнивают несколько ответов на один запрос. Из оценки качества они получают относительный обучающий сигнал: положительный усиливает вероятность ответа, отрицательный подавляет её. Авторы называют этот сигнал преимуществом ответа.

Если добавить штраф за длину прямо к исходным оценкам, изменится не только целевой ответ. Алгоритм заново вычислит среднее и разброс внутри всей группы, поэтому даже ответ без штрафа может перейти из положительной части в отрицательную. Краткость тогда не уточняет предпочтение по качеству, а отменяет его.

На сохранённых группах ответов один и тот же вариант GR3 менял знак преимущества в 11,73% случаев при плавных оценках качества и в 0,30% случаев после сведения тех же оценок к бинарным. Этот опыт не воспроизводит полный цикл обучения, но показывает, почему методы из задач с проверяемым ответом нельзя автоматически переносить на открытые задачи.

Как QGLAS отделяет краткость от качества

QGLAS сначала рассчитывает преимущества только по качеству и фиксирует их знаки. После этого длина может изменить силу положительного сигнала, но не его направление. Ответ, который качество велит подавлять, не получит поощрение только за краткость.

Метод выбирает ответы с положительным преимуществом и вычисляет их среднюю длину. Более короткие варианты получают ограниченную прибавку. Длинные положительные ответы не штрафуются, а отрицательные остаются без изменений. Короткие плохие ответы также не задают ориентир длины для группы.

Сила прибавки зависит от структуры оценок. Когда хорошие ответы почти не различаются по качеству, краткость сильнее влияет на выбор между ними. Если один ответ заметно лучше остальных, его содержательное преимущество доминирует, а влияние длины ослабевает.

Такой порядок гарантирует сохранение знака, но не сохраняет полное ранжирование. Короткий ответ может обойти немного более качественный длинный ответ внутри положительной группы. Проверка показывает, что такие перестановки сосредоточены среди вариантов с близкими исходными оценками — именно там метод и трактует краткость как вторичный критерий.

Когда команде стоит менять схему обучения

Метод проверяли на Qwen3-4B и GLM-4.7-Flash. Обучающие запросы охватывали следование инструкциям, письмо и поддержку решений, а качество оценивали на IFBench, Hard Prompts из Arena-Hard-v2 и Creative Writing. В сравнение вошли обучение только по качеству, QGLAS и методы GR3 и GRLC; длина учитывала как рассуждение, так и финальный ответ.

На Qwen3-4B QGLAS сократил средний ответ на 32,4% и при этом сохранил весь средний прирост качества относительно базовой модели. GR3 и GRLC при сопоставимом сокращении теряли часть этого прироста. Результат повторился с обученной моделью награды, оценкой по рубрике и оценкой другой LLM без отдельной настройки метода под каждый источник.

Разбор компонентов показывает, что результат даёт не один запрет на смену знака. Если убрать все структурные ограничения, сохранение прироста качества падает до 60,0% при близкой степени сокращения. Если оставить ограничения, но заменить адаптивную силу бонуса фиксированной, показатель снижается до 82,0%, хотя ответы сокращаются слабее.

Работа меняет план, если команда уже применяет групповое RL с плавной оценкой качества и управляет длиной через штраф или надбавку к награде. В таком контуре стоит сначала вычислять сигнал качества, затем разрешать длине усиливать только короткие хорошие ответы и подбирать силу этого усиления по различиям внутри текущей группы.

Это не готовая настройка для любого продукта. Проверка охватывает указанные модели, открытые задачи и групповой алгоритм GSPO, поэтому перенос на другие размеры моделей, способы вычисления преимущества и производственные распределения запросов требует собственного сравнения качества и длины. Практический вклад работы — не конкретный коэффициент, а проверяемое правило: краткость может выбирать между близкими хорошими ответами, но не должна превращать плохой ответ в обучающую цель.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу