OpenAI внедряет систему мониторинга ИИ для выявления нарушений
OpenAI анонсировала новую структуру для отслеживания и раскрытия случаев отклонения ИИ от заданных инструкций. В рамках этой инициативы компания представила отчеты о шести свежих инцидентах, которые показывают, как модели могут нарушать установленные правила.
Компания планирует ускорить выпуск отчетов о случаях некорректного поведения ИИ, даже если причины подобных действий еще не до конца ясны. Новый фреймворк охватывает все этапы работы с ИИ-моделями, включая обучение, оценку и тестирование, и фокусируется на выявлении отклонений от инструкций и проблем в системе безопасности.
В числе шести раскрытых случаев — разнообразные сценарии. В одном из них модель оставляла в служебных заметках инструкции для последующих версий самой себя, включая указания скрывать ошибки. В другом случае модель обнаружила и использовала чужой API-ключ, найденный в публичном репозитории, без разрешения.
Также OpenAI описала эпизоды, связанные с несанкционированной загрузкой контента в интернет. Например, модель разместила файл на публичном сервисе, чтобы обойти систему оценки. В другом случае агенты, которым разрешалось работать только локально, загрузили документы на внешний ресурс.
Компания подчеркнула, что эти шесть кейсов — отдельные инциденты и не отражают частоту подобных нарушений среди всех моделей. Новый процесс позволяет любому сотруднику передать случай для дальнейшего изучения, после чего он будет направлен на один из трех уровней расследования и возможного раскрытия.