Журнал · Rit.work

Читать и менять признаки нужно в разных слоях LLM

Точность линейного классификатора не показывает, в каком слое омни-модальной LLM лучше менять активации: эффективная зона находится ближе к концу сети.

Rit.work
Студия разработки
22 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Слой, где омни-модальная LLM лучше всего распознаёт эмоцию во внутренних представлениях, оказался не лучшим местом для изменения её ответа. В препринте, который не прошёл рецензирование, числа получили сами авторы: вмешательство в подходящей зоне действовало примерно в 26 раз сильнее, чем в слое с самым точным распознаванием. Значит, выбирать место вмешательства только по точности линейного классификатора не стоит.

Для каждого слоя обучили линейный классификатор, который определял эмоцию по внутреннему представлению текста, аудио или изображения. Затем в активации добавляли направление целевой эмоции и проверяли, насколько она проявилась в сгенерированном тексте. В контрольных опытах вместо него подставляли случайное направление той же величины.

Слои с лучшим распознаванием признака располагались почти по всей глубине моделей — от 0,29 до 1,00, если считать вход началом сети, а выход концом. Эффективные для вмешательства слои собрались в более узкой средней и поздней зоне: от 0,48 до 0,74. В Qwen2.5-Omni-7B классификатор достиг максимума в слое L27, а изменение ответа — в L20; вмешательство в L27 почти не отличалось от случайного.

Результат объясняется оставшимся запасом обработки. На позднем слое эмоцию уже легко прочитать, но следующие слои почти не успевают преобразовать внесённое изменение в ответ. Раньше по сети признак уже сформирован, а модель ещё может усилить вмешательство. Поэтому при настройке управления активациями полезно отдельно строить кривые читаемости и фактического влияния на результат.

Проверка охватила Qwen2.5-Omni-7B, Phi-4-Multimodal и MiniCPM-o-4.5, текст, аудио и изображения. Опыты ограничены моделями масштаба до 7B, преимущественно английскими данными об эмоциях, линейными направлениями и управлением текстовой генерацией. Средняя и поздняя зона поэтому служит стартовой областью для поиска, а не универсальным номером слоя.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу