Журнал · Rit.work

Редкие сбои агентов ищут через веса языковой модели

Iterative Unalignment меняет веса языковой модели, чаще вызывает редкие сбои и затем вычисляет их исходную вероятность с учётом внесённых искажений.

Rit.work
Студия разработки
22 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Вероятность редкого сбоя языкового агента научились оценивать без миллиардов обычных запусков. В нерецензированном препринте, где числа получили сами авторы, метод Iterative Unalignment оказался более чем в 800 раз эффективнее прямого перебора для событий с вероятностью ниже 10−7. Такой подход позволяет количественно оценивать остаточный риск, а не только находить единичный пример опасного поведения.

Hanming Yang, Daksh Mittal, Jing Dong и Hongseok Namkoong рассматривают случай с фиксированным запросом, где сбой возникает из-за случайности в ответах модели. Обычный метод Монте-Карло почти не встречает такие траектории. Выборка по значимости (importance sampling) вызывает их чаще, а затем корректирует результат с учётом того, насколько изменилось распределение ответов.

В качестве изменённого распределения выступает копия исходной языковой модели с другими весами. Градиентный поиск сдвигает её к целевому событию, а адаптивная регуляризация не даёт ей сосредоточиться на нескольких удобных траекториях и пропустить остальные. После генерации каждый ответ получает вес, равный отношению его вероятностей в исходной и изменённой моделях.

Метод проверили на GPT-2 Small и Gemma-2, на трёх семействах из более чем 300 событий. Тесты включали появление заданных токенов, их сочетания и превышение порога классификатора; самые редкие события имели вероятность порядка 10−9. Эталонные вероятности вычисляли отдельно, чтобы сравнивать не только частоту найденных сбоев, но и точность итоговой оценки.

Выигрыш более чем в 800 раз учитывает и генерацию ответов, и обучение изменённой модели. Практический вывод пока относится к сравнительно небольшим моделям и искусственно заданным событиям, но сама схема подходит для проверки агента перед запуском: определить опасный исход, усилить его во временной копии модели и пересчитать вероятность для исходных весов.

Источники

Иллюстрация: рисунок из статьи «Rare Event Estimation via Iterative Unalignment», Hanming Yang, Daksh Mittal, Jing Dong и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу