Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Настройки полезности, честности и безопасности языковой модели научились менять во время генерации, не переобучая её. Swiss-Knife получил сводную оценку 0,797 против 0,750 у лучшего базового метода, хотя препринт не проходил рецензирование и содержит замеры самих авторов. Подход превращает выравнивание модели из отдельного цикла обучения в конфигурацию, которую можно переключать во время работы.
Цели стали внешней конфигурацией генератора
Обычное выравнивание закрепляет требования в весах модели через RLHF или DPO. Если политика продукта меняется, команде приходится снова настраивать модель либо держать несколько её вариантов.
Выравнивание при декодировании оставляет основную LLM замороженной. Система генерирует несколько продолжений, оценивает их внешними моделями вознаграждения и выбирает подходящее. Но большинство таких методов заранее сводит все оценки к одному числу, после чего берёт кандидата с максимальным результатом.
Swiss-Knife разбивает этот процесс на заменяемые части. Модель-предложитель создаёт семь вариантов следующего смыслового шага. Отдельные адаптеры LoRA оценивают каждый вариант по полезности, честности и безвредности, а также возвращают меру неопределённости. Вероятность текста у модели-предложителя выступает ещё одной оценкой и удерживает ответы в рамках связной речи.
Набор оценщиков и их веса образуют внешнюю спецификацию. Её можно заменить во время исполнения: например, усилить безвредность для одного сценария и полезность для другого. Основная модель и модель-предложитель при этом не меняются, градиенты считать не нужно.
Нормализация не даёт одному оценщику захватить управление
Независимо обученные модели вознаграждения используют разные шкалы. Одна может выдавать значения в узком диапазоне, другая — в широком. Простая взвешенная сумма в таком случае не соблюдает заданные веса: оценщик с большим разбросом влияет сильнее остальных.
Swiss-Knife нормализует оценки внутри текущего набора кандидатов. Для каждого оценщика система вычитает среднее значение и делит результат на разброс. После этого вес означает именно долю влияния, а не сочетание желаемой доли и случайного масштаба конкретной модели вознаграждения.
Без нормализации сводная оценка F1 упала на 0,217. F1 здесь — гармоническое среднее результатов по трём целям, которое штрафует систему за провал хотя бы по одной из них. Оценщик честности при равных заявленных весах сохранил лишь 9% фактического влияния: его исходные оценки менялись слабее, чем оценки двух других адаптеров.
После объединения целей система не выбирает наибольшую абсолютную оценку. Она сравнивает кандидатов попарно, учитывает разницу результатов и неопределённость, а затем проводит турнир по схеме Elo. Победителя не всегда берут детерминированно: его выбирают из итогового распределения.
Авторы доказывают, что целый класс таких правил устойчив к небольшим искажениям оценки. Обычный выбор максимума может мгновенно переключиться на другого кандидата, если два варианта близки. Попарное правило меняет вероятности постепенно, поэтому единичный шаблон, который модель вознаграждения систематически переоценивает, получает меньше шансов захватить генерацию.
В отдельной проверке попарная агрегация снизила токсичность по оценке модели-судьи на 47% относительно детерминированного турнира без потери качества ответа. Это не доказывает безопасность системы: эксперимент измеряет оценки автоматического судьи, а не поведение в производственной среде.
Когда настройка на лету окупает замедление
Работа меняет архитектурный выбор для продуктов, где требования зависят от клиента, юрисдикции или этапа процесса. Вместо набора контрольных точек модели можно держать одну основу, подключать нужные оценщики и менять их веса. Переключение адаптера заняло 0,05 мс, поэтому сами изменения политики почти не добавляют задержки.
Цена возникает при каждой генерации. Swiss-Knife обрабатывал 2,13 токена в секунду против 24,5 у замороженной основной модели: скорость снизилась более чем в десять раз. Причина не в переключении конфигурации, а в генерации набора кандидатов и их многократной оценке.
Подход подходит для автономных агентов, пакетной обработки и других сценариев, где политика меняется чаще, чем команда готова переобучать модель, а задержка отдельного ответа не определяет экономику продукта. Для диалогового интерфейса с жёстким временем отклика дополнительное декодирование пока может оказаться дороже нескольких заранее подготовленных вариантов модели.
Проверку провели на одной семье основных моделей и с одной семьёй моделей-судей. Использованная мера неопределённости отражала уверенность в следующем токене, но почти не показывала, насколько оценщик ошибается в качестве ответа. Кроме того, веса меняли достигнутый компромисс слабее ожидаемого: система надёжно смешивала цели, но управляла ими в сравнительно узком диапазоне.
Практический результат работы — не готовая замена RLHF, а схема для отделения изменяемой политики от весов LLM. Перед внедрением команде придётся проверить собственные оценщики, диапазон управления целями и бюджет задержки. Если эти проверки проходят, новую политику можно доставлять как конфигурацию, а не как новую версию всей модели.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



