Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Lingyu Li, Yan Teng, Yingchun Wang и Xia Hu предложили новый подход к настройке безопасного поведения LLM; их препринт не проходил рецензирования. По замерам авторов, он стабильнее повышал устойчивость к состязательным атакам, тогда как обучение только по ответам в проведённых экспериментах увеличивало уязвимость. Работа важна командам, которые выбирают метод настройки моделей для систем с требованиями к безопасности.
Что сделали
Авторы исходят из того, что LLM могут выдавать ожидаемые моральные оценки для знакомых формулировок, но хуже распознавать тот же вредоносный замысел в непривычной форме. При анализе 23 LLM они обнаружили, что модели часто не различали противоположные моральные категории и не сохраняли градации типичности внутри категории.
Предложенный метод оптимизации сходства представлений перестраивает скрытые представления модели — внутренние признаки, на которых основано продолжение текста. Цель обучения задаётся через соответствие категоризации в модели структуре человеческих моральных оценок, без прямого контроля сгенерированных ответов.
В сопоставленных экспериментах оба подхода использовали одни и те же 251 334 аннотации. Обычное поведенческое выравнивание улучшало явные моральные оценки, но почти не меняло внутреннюю структуру категорий. Перестройка представлений дала меньший прирост в явных оценках, однако, по утверждению авторов, устойчиво улучшала сопротивляемость разным атакам при разных масштабах моделей.
Что это значит
Хорошие ответы на проверочном наборе ещё не показывают, что модель научилась распознавать вредоносный замысел независимо от формулировки. Если результат подтвердится, при выборе способа настройки стоит отдельно проверять перенос безопасного поведения на новые и специально искажённые запросы, а не оценивать только долю ожидаемых ответов.
Ограничения. Материал подготовлен по абстракту, поскольку полный текст работы получить не удалось. В нём не названы модели, бенчмарки, способы атак и численные размеры улучшений, поэтому оценить практическую величину эффекта нельзя. Из доступного текста также неясно, сколько моделей участвовало непосредственно в обучающих экспериментах и как подход сравнивался с другими методами, кроме стандартного поведенческого выравнивания.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



