Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Нужное поведение LLM научились усиливать прямо во время генерации, не меняя веса базовой модели. В работе, которая не прошла рецензирование и содержит замеры самих авторов, метод CAST достиг результатов на уровне DPO в трёх разных задачах. Такой контроллер можно подключать и отключать отдельно от модели, если требуемое поведение уже ей доступно, но проявляется нестабильно.
Как измеряли влияние компонентов на предпочтение
Авторы рассматривают генерацию как конкуренцию вычислений внутри остаточного потока — общего состояния, которое последовательно меняют механизмы внимания и полносвязные блоки. Одни компоненты могут подталкивать модель к нужному ответу, а другие одновременно снижать его вероятность.
Чтобы увидеть эту конкуренцию, для каждой задачи сначала задают численную оценку предпочтения. В ConFiQA она показывает, выбирает ли модель сведения из предоставленного контекста вместо запомненного знания; в IMDb — выражает ли текст нужную тональность; в TL;DR — насколько модель предпочитает заданное краткое изложение альтернативе.
Затем Residual Competition Maps, или RCM, по очереди вмешивается в работу отдельных компонентов. Основной вариант временно обнуляет выход компонента и сравнивает результат с обычным запуском. Если после возвращения компонента оценка предпочтения растёт, компонент считают поддерживающим цель; если падает — конкурирующим с ней.
Это причинное сравнение, а не попытка разложить итоговый ответ на независимые слагаемые. Изменение одного компонента влияет на все последующие вычисления, поэтому карта показывает направление вмешательства, но не долю ответа, за которую компонент якобы отвечает.
Роли зависят от входных данных: один механизм внимания может помогать на части запросов и мешать на других. В отдельных примерах вмешательства в единственный компонент хватало, чтобы модель сменила предпочтение. После DPO карта заметно перестраивалась, однако конкурирующие эффекты могли сохраняться даже при правильном итоговом ответе.
Как из карты собирают контроллер скрытых состояний
RCM сначала сканирует крупные участки модели, а затем отдельные механизмы внимания. Для контроллера выбирают места, где вмешательство устойчиво сдвигает оценку в нужную сторону. Так поиск не приходится проводить по всем параметрам модели.
CAST меняет состояние выбранного компонента перед тем, как тот запишет результат в остаточный поток. В простой версии контроллер добавляет постоянный вектор, в другой применяет преобразование низкого ранга. Базовые веса остаются замороженными.
Контроллер обучают на парах предпочтительных и нежелательных ответов. Целевая функция устроена по тому же принципу, что и в DPO: она увеличивает относительную оценку лучшего ответа по сравнению с худшим и с запуском без контроля. Поэтому речь идёт не о способе без обучения, а о переносе обучения из весов модели в небольшой набор вмешательств.
Активные контроллеры содержали от 256 до 16 384 параметров. Их применяли либо только при обработке запроса, либо также во время генерации. Момент вмешательства оказался существенным: на ConFiQA режимы по-разному влияли на точность ответа и следование предоставленному контексту.
На IMDb CAST достиг уровня награды DPO при меньшем расхождении распределений токенов KL: примерно 0,0166 против 0,0183. На TL;DR метод приблизился к DPO на обеих проверенных модельных семьях и обошёл соответствующие результаты BiPO и LoReFT. На ConFiQA картина была смешанной: отдельные конфигурации превосходили DPO, но BiPO и LoReFT оставались сильнее в части режимов.
Когда отдельный контроллер меняет планы разработки
Метод подходит для продукта, где одна базовая модель должна переключаться между несколькими правилами поведения. Вместо отдельных дообученных копий можно хранить компактные контроллеры и включать нужный во время вывода. Работа также показывает, что CAST можно переносить на модель после DPO или обучать поверх неё, хотя улучшения зависят от задачи и режима.
Главное условие — модель уже должна уметь выдавать целевое поведение хотя бы в части запусков. CAST регулирует внутреннюю конкуренцию, но не создаёт отсутствующий навык. Для новой предметной области, незнакомого языка или недостающего знания по-прежнему потребуется обучение весов, внешние данные либо поиск по базе знаний.
Внедрение требует доступа к скрытым состояниям и внутренним компонентам модели. Для закрытого API, который возвращает только текст или вероятности токенов, такой контроллер неприменим. Карты и сами вмешательства также привязаны к конкретной модели и заданному предпочтению.
Проверка охватывает ConFiQA, IMDb и TL;DR на моделях семейств Llama и Qwen, а сравнения сделаны на фиксированных контрольных точках, без оценки разброса между повторными обучениями. Работа поэтому обосновывает архитектурный вариант для обратимого управления поведением, но ещё не даёт оснований оценивать задержку и надёжность CAST в производственной системе.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



