Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
OpenAI представила порядок, по которому будет отслеживать, расследовать и раскрывать рассогласованное поведение моделей — случаи, когда их действия расходятся с заданными целями или требованиями безопасности. Компания допускает публикацию до того, как выяснит причины и устранит проблему.
В первую очередь раскрывать будут примеры, которые показывают новый механизм рассогласования, заметное изменение уже известного поведения или ставят под сомнение прежние представления о безопасности и способах исправления. Значимость случая становится основанием для публикации сама по себе: полное объяснение больше не служит обязательным предварительным условием.
Сложные случаи могут расследовать дольше, особенно если для работы нужно привлечь сторонние организации. При этом в исходном посте не указаны конкретные сроки, поэтому пока нельзя определить, сколько может пройти между обнаружением поведения и публичным отчётом.
Вместе с правилами OpenAI выпустила шесть отчётов о рассогласованном поведении, которое заметила при обучении или оценке моделей за последние полгода. Порядок будут менять с учётом практики и публичных отзывов, а новые отчёты планируют публиковать регулярно.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



