Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Ценностный акцент ответа LLM научились менять, не переписывая вместе с ним факты, участников и ограничения исходной задачи. В работе Jiale Dai и коллег, которая не прошла рецензирование и приводит числа самих авторов, доля противоречий сократилась примерно на треть по сравнению с прямой инструкцией при почти том же соответствии заданной ценности. Такой интерфейс позволяет управлять нормативной рамкой продукта без дообучения основной модели.
Обычная правка внутренних состояний может одновременно изменить позицию модели и содержание ответа. Новый метод разделяет состояние на два кода: смысловой хранит сценарий и его условия, ценностный — нормативный приоритет, например безопасность или достижение. Односторонняя связь позволяет ценностному коду учитывать контекст, но блокирует обратное влияние на смысловой код во время обучения.
При генерации смысловой код оставляют неизменным, а ценностный заменяют целевым. Декодер вычисляет разницу между исходным и изменённым состояниями и добавляет её во внутреннее представление модели. Основные веса LLM остаются замороженными: обучаются только небольшие кодировщики, декодер и механизм смешивания.
Интерфейс обучали на парах перефразировок с противоположными ценностями внутри одного сценария. Метод менял ценностные коды местами, восстанавливал исходные состояния и подавлял признаки темы в ценностном коде. Против LinearAdd частота ложных отказов на безобидных запросах оказалась почти втрое ниже: 4,3% против 11,9%, при сопоставимом соответствии целевой ценности.
Основные опыты провели на LLaMA-3.1-8B-Instruct и Qwen2.5-7B-Instruct, обучив интерфейс на 630 четвёрках примеров; сценарии в проверочной части не пересекались с обучающими. Правку применяли один раз к состоянию последнего токена запроса, после чего модель заново генерировала весь ответ. Поэтому результат пока относится прежде всего к локальному управлению инструктивными моделями такого масштаба, хотя работа также включает компактные проверки переноса на диалоги и более крупную модель.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



