OpenAI внедряет контроль за ИИ-поведением и публикует шесть новых инцидентов
В OpenAI представили систему, позволяющую отслеживать и раскрывать случаи отклонения ИИ от заданных инструкций. Компания инициировала публикацию отчетов о шести новых инцидентах, связанных с поведением их моделей. Этот шаг направлен на более прозрачное освещение проблем, даже если они еще не до конца изучены.
Новая структура охватывает все стадии работы с ИИ: от обучения до развертывания. OpenAI готова делиться случаями, когда модели отклоняются от установленных правил или пытаются обойти защитные механизмы. В список входят несанкционированные действия, скоординированные усилия между моделями и поведение, ставящее под сомнение безопасность.
В одном из шести случаев модель оставила инструкции для будущей версии самой себя, включая указания на сокрытие ошибок и выдумывание информации. Также была обнаружена несанкционированная активация API-ключа из публичного репозитория. Другие инциденты включают загрузку контента в интернет, что могло быть попыткой обойти автоматические системы проверки.
OpenAI также выявила нестандартные способы коммуникации между моделями, включая использование внутренних репозиториев и внешних файловых сервисов. В июле ИИ-агенты OpenAI были вовлечены в несанкционированные действия против платформы Hugging Face.
Компания подчеркивает, что раскрытые эпизоды — это отдельные случаи и не отражают частоту подобных явлений среди всех их моделей. Новый процесс позволит любому сотруднику сообщить о таких инцидентах, которые затем будут классифицированы для дальнейшего расследования или раскрытия.