Журнал · Rit.work

MISVO управляет ответами LLM без изменения её параметров

MISVO подстраивает замороженную LLM под внешний критерий и ограничивает сдвиг распределения ответов через локальную геометрию KL-дивергенции.

Rit.work
Студия разработки
25 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Замороженную LLM научились подстраивать под внешний критерий во время генерации, сдерживая изменение распределения ответов. MISVO из работы Johns Hopkins University показал лучший средний результат в шести из семи сочетаний модели и задачи, хотя препринт не рецензирован и все числа получили сами авторы. Метод подходит для критериев, которые меняются от запроса к запросу или работают как внешний чёрный ящик, но требует отдельной оптимизации при каждом запуске.

Как штраф учитывает влияние вмешательства на токены

MISVO управляет моделью перед её выходной головой — слоем, который преобразует скрытое состояние в оценки следующих токенов. Для каждой позиции ответа метод добавляет свой вектор к скрытому состоянию. Параметры модели остаются замороженными, поэтому обратное распространение через весь трансформер не требуется.

Векторы подбираются под итоговую оценку ответа. Её может выдавать модель предпочтений, набор тестов для кода или другой недифференцируемый вычислитель. MISVO генерирует несколько ответов, сравнивает их оценки и по выбранным токенам приближённо вычисляет, в какую сторону менять векторы.

Без ограничения такая оптимизация находит вмешательства, которые повышают оценку, но резко меняют вероятности токенов. Обычный штраф за длину вектора решает проблему неточно: два равных по длине сдвига могут по-разному повлиять на выход модели.

MISVO вместо этого использует локальную геометрию KL-дивергенции — меры различия двух распределений вероятностей. Штраф строится через информацию Фишера и учитывает, насколько конкретное направление меняет относительные оценки токенов. Его значение равно половине дисперсии вызванных сдвигов логитов под исходным распределением: одинаковое изменение всех логитов ничего не стоит, потому что вероятности токенов от него не меняются.

Полный градиент последовательной KL-дивергенции состоит из прямого влияния на текущий токен и косвенного влияния через будущие префиксы. Второй компонент трудно оценивать без большого разброса. Авторы показывают, что рядом с нулевым вмешательством он имеет второй порядок по величине сдвига, поэтому фиксированный штраф Фишера совпадает с полным градиентом в первом приближении.

Матрицу штрафа оценивают по первой партии ответов исходной модели и затем используют повторно. Её не обязательно хранить целиком: произведение матрицы на вектор можно вычислить через выходную голову. Это сокращает память по сравнению с явным хранением отдельной матрицы для каждой позиции.

Где управление улучшило внешний результат

Метод проверили на LFM2.5-1.2B-Instruct, Gemma3-4B-IT, Llama-3-8B-Instruct и Phi-4. На SHP ответы оценивала отдельная модель предпочтений, а на MBPP+ наградой служила доля пройденных тестов. Генерацию ограничивали 512 новыми токенами.

Сравнение включало AISP и Best-of-N — выбор лучшего ответа среди независимых генераций исходной модели. Всем методам давали одинаковый бюджет кандидатов, а основным результатом считали лучший найденный ответ.

На MBPP+ для LFM2.5 MISVO получил долю пройденных тестов 0,739 против 0,703 у Best-of-N. В диагностике на SHP для той же модели KL-дивергенция на префиксах исходной политики составила 47,5 против 303,9 у AISP. Это не полная дивергенция последовательностей, но замер показывает, что в проверенной конфигурации MISVO меньше менял вероятности токенов на знакомых модели контекстах.

Разнообразие и связность ответов оставались близки к Best-of-N. Эти показатели обнаруживают повторения и смысловую связь ответа с запросом, но не подтверждают фактическую точность и не исключают подстройку под оценщик. На SHP одна модель награды использовалась и при поиске, и при основной оценке результата.

Меняет ли MISVO планы продуктовой команды

MISVO стоит рассматривать, если критерий качества появляется только во время выполнения. Это может быть пользовательская настройка, меняющееся бизнес-правило, исполняемые тесты или закрытый оценщик с доступом только к итоговому баллу. Для такого сценария метод позволяет оставить веса LLM неизменными и управлять каждым запросом отдельно.

Для стабильного критерия MISVO не заменяет дообучение. Он многократно генерирует ответы и обновляет векторы для одного запроса, поэтому добавляет задержку, вычисления выходной головы и хранение состояний. Эксперименты запускали на H200 без объединения разных запросов в пакет, а реализация потребляла больше пиковой памяти, чем сравниваемые способы.

Практический план меняется не на уровне выбора базовой модели, а на уровне контура вывода. Команде потребуется доступ к скрытому состоянию перед выходной головой, управляемый цикл генерации и достаточно быстрый внешний оценщик. Закрытый API, который возвращает только текст, не даёт нужной точки вмешательства.

Локальное приближение также задаёт рабочую границу метода. Оно обосновано для небольших сдвигов и фиксированной длины ответа, но не гарантирует малое отклонение после длинной траектории оптимизации. Поэтому внедрение стоит начинать со сравнения с Best-of-N при одинаковом бюджете генераций и отдельно измерять задержку, память и изменение распределения токенов.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу