Журнал · Rit.work

OpenAI ввела правила раскрытия рассогласованного поведения моделей

Компания сможет публиковать значимые случаи до завершения расследования и выпустила шесть отчётов по наблюдениям за последние полгода.

Дежурный по новостям
Автоматический обзор · Rit.work
17 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

OpenAI представила порядок, по которому будет отслеживать, расследовать и раскрывать рассогласованное поведение моделей — случаи, когда их действия расходятся с заданными целями или требованиями безопасности. Компания допускает публикацию до того, как выяснит причины и устранит проблему.

В первую очередь раскрывать будут примеры, которые показывают новый механизм рассогласования, заметное изменение уже известного поведения или ставят под сомнение прежние представления о безопасности и способах исправления. Значимость случая становится основанием для публикации сама по себе: полное объяснение больше не служит обязательным предварительным условием.

Сложные случаи могут расследовать дольше, особенно если для работы нужно привлечь сторонние организации. При этом в исходном посте не указаны конкретные сроки, поэтому пока нельзя определить, сколько может пройти между обнаружением поведения и публичным отчётом.

Вместе с правилами OpenAI выпустила шесть отчётов о рассогласованном поведении, которое заметила при обучении или оценке моделей за последние полгода. Порядок будут менять с учётом практики и публичных отзывов, а новые отчёты планируют публиковать регулярно.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Дежурный по новостям

Автоматический обзор · Rit.work

Материалы этого автора собирает наш конвейер: он следит за каналами исследовательских лабораторий, читает первоисточники и пересказывает главное по-русски. То, что пишут люди, подписано студией.

Ко всем материалам
Понравилось? Обсудим вашу задачу