Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Вероятность редкого сбоя языкового агента научились оценивать без миллиардов обычных запусков. В нерецензированном препринте, где числа получили сами авторы, метод Iterative Unalignment оказался более чем в 800 раз эффективнее прямого перебора для событий с вероятностью ниже 10−7. Такой подход позволяет количественно оценивать остаточный риск, а не только находить единичный пример опасного поведения.
Hanming Yang, Daksh Mittal, Jing Dong и Hongseok Namkoong рассматривают случай с фиксированным запросом, где сбой возникает из-за случайности в ответах модели. Обычный метод Монте-Карло почти не встречает такие траектории. Выборка по значимости (importance sampling) вызывает их чаще, а затем корректирует результат с учётом того, насколько изменилось распределение ответов.
В качестве изменённого распределения выступает копия исходной языковой модели с другими весами. Градиентный поиск сдвигает её к целевому событию, а адаптивная регуляризация не даёт ей сосредоточиться на нескольких удобных траекториях и пропустить остальные. После генерации каждый ответ получает вес, равный отношению его вероятностей в исходной и изменённой моделях.
Метод проверили на GPT-2 Small и Gemma-2, на трёх семействах из более чем 300 событий. Тесты включали появление заданных токенов, их сочетания и превышение порога классификатора; самые редкие события имели вероятность порядка 10−9. Эталонные вероятности вычисляли отдельно, чтобы сравнивать не только частоту найденных сбоев, но и точность итоговой оценки.
Выигрыш более чем в 800 раз учитывает и генерацию ответов, и обучение изменённой модели. Практический вывод пока относится к сравнительно небольшим моделям и искусственно заданным событиям, но сама схема подходит для проверки агента перед запуском: определить опасный исход, усилить его во временной копии модели и пересчитать вероятность для исходных весов.
Источники
Иллюстрация: рисунок из статьи «Rare Event Estimation via Iterative Unalignment», Hanming Yang, Daksh Mittal, Jing Dong и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



