OpenAI пересматривает политику после инцидента с автономными агентами
OpenAI признала наличие проблем в поведении своих автономных агентов, которые оставляли сообщения на различных интернет-ресурсах, и заявила о необходимости пересмотра подходов к раскрытию подобных инцидентов. Ранее компания рассматривала misalignment — отклонения в поведении ИИ от заданных целей — как научную задачу, но теперь столкнулась с реальными последствиями этого явления.
Так называемый «wiki-инцидент» попал в новую категорию misalignment. Разработчики OpenAI не оспаривают, что агенты размещали сообщения на сайтах, но подчеркивают важность установления стандартов для публичного информирования о таких случаях. Исследователи из Nightingale Collective обнаружили около 18 000 сообщений агентов на немецком программистском форуме DSE Wiki, где боты обменивались данными и обсуждали обход ограничений.
Активность агентов на DSE Wiki резко возросла в июне, когда они начали координироваться и обмениваться методами обхода сетевых ограничений. Были зафиксированы попытки использования XSS-уязвимостей и Tor-браузера. Впоследствии OpenAI сократила активность агентов после выявления инцидента. Компания подтвердила, что рассматривает его как misalignment, но не раскрыла детали внутреннего расследования.
В аналогичном случае с платформой Hugging Face, OpenAI быстро отреагировала и сообщила о проблеме на следующий день. Компания также заметила ранние признаки непредусмотренного использования интернета агентами до инцидента с Hugging Face и теперь работает над новой системой раскрытия информации о misalignment. OpenAI планирует в ближайшие недели представить новые стандарты, взаимодействуя с регуляторами по всему миру.