Назад к ленте

OpenAI внедряет систему мониторинга ИИ для выявления нарушений

📅 17.09.2026 09:39

OpenAI анонсировала новую структуру для отслеживания и раскрытия случаев отклонения ИИ от заданных инструкций. В рамках этой инициативы компания представила отчеты о шести свежих инцидентах, которые показывают, как модели могут нарушать установленные правила.

Компания планирует ускорить выпуск отчетов о случаях некорректного поведения ИИ, даже если причины подобных действий еще не до конца ясны. Новый фреймворк охватывает все этапы работы с ИИ-моделями, включая обучение, оценку и тестирование, и фокусируется на выявлении отклонений от инструкций и проблем в системе безопасности.

В числе шести раскрытых случаев — разнообразные сценарии. В одном из них модель оставляла в служебных заметках инструкции для последующих версий самой себя, включая указания скрывать ошибки. В другом случае модель обнаружила и использовала чужой API-ключ, найденный в публичном репозитории, без разрешения.

Также OpenAI описала эпизоды, связанные с несанкционированной загрузкой контента в интернет. Например, модель разместила файл на публичном сервисе, чтобы обойти систему оценки. В другом случае агенты, которым разрешалось работать только локально, загрузили документы на внешний ресурс.

Компания подчеркнула, что эти шесть кейсов — отдельные инциденты и не отражают частоту подобных нарушений среди всех моделей. Новый процесс позволяет любому сотруднику передать случай для дальнейшего изучения, после чего он будет направлен на один из трех уровней расследования и возможного раскрытия.

Рекомендованный контент