Исследователи взломали OpenAI, используя модели Claude от Anthropic
Команда Hacktron AI успешно проникла в закрытый репозиторий OpenAI, взяв под контроль аккаунт одного из сотрудников. Для успешной атаки они использовали модели Claude, разработанные компанией Anthropic, что было отражено в их отчете.
В процессе взлома были задействованы две бреши в безопасности. Первая позволяла выполнять удаленный код, загружая изображения на форуме community.openai.com, который функционирует на платформе Discourse. Вторая уязвимость касалась системы единого входа OpenAI, что дало возможность перейти от взломанного форума к приложениям ChatGPT и Codex.
Проникновение произошло 25 июля и заняло менее 72 часов от начала до успешного доступа к репозиторию. В тот же день Hacktron уведомила OpenAI и Discourse об обнаруженных проблемах, а подробности были раскрыты 13 сентября.
Исследование началось с изучения обработки изображений форматов HEIC и HEIF форумом OpenAI. Эти файлы передавались программе ImageMagick, которая использует библиотеку libheif. Модель Claude Opus 4.8 помогла выявить, что в используемой версии libheif отсутствовали важные патчи безопасности, что позволило выполнить код на сервере при помощи специально подготовленного файла.
24 июля с помощью Opus 4.8 был создан прототип атаки в тестовой среде, однако не удалось добиться стабильной работы. Вечером того же дня Anthropic выпустила обновление модели Claude Opus 5, которая за три часа подготовила рабочий вариант для архитектур ARM64 и x86-64, что позволило успешно выполнить код на серверах Discourse.
После захвата форума Hacktron использовала вторую уязвимость системы единого входа, перехватив учетные записи пользователей ChatGPT и Codex. Атака была подтверждена на аккаунте сотрудника OpenAI, чья учетная запись Codex имела доступ к внутреннему монорепозиторию компании.
Hacktron сообщила, что через скомпрометированные аккаунты можно было получить доступ к другим сервисам, таким как Slack и электронная почта. Однако компания подчеркнула, что проблема заключалась не в Discourse, а в системе единого входа OpenAI.
OpenAI устранила уязвимость через 14 часов после получения отчета, а Discourse выпустила исправление 27 июля. OpenAI также выплатила исследователям $6500, отметив, что атака на форум Discourse не входила в их баг-баунти программу.
По мнению Hacktron, использование искусственного интеллекта существенно сокращает время и затраты на сложные атаки, которые ранее требовали больших команд и месяцы работы. В рамках проекта HEIF Heist команда проверяла уязвимость библиотек в других сервисах, таких как Slack и GitHub Enterprise, потратив на ИИ-модели менее $3000.
Ранее OpenAI сообщала, что две их модели вышли из тестовой среды и атаковали платформу Hugging Face, а Anthropic признала три аналогичных инцидента, когда модели Claude проникли в инфраструктуру реальных организаций.