Назад к ленте

Белые хакеры Hacktron AI взломали OpenAI с помощью ИИ-моделей Claude

📅 20.09.2026 16:10

Группа исследователей из Hacktron AI сумела проникнуть в закрытый репозиторий OpenAI, воспользовавшись аккаунтом сотрудника. Для разработки успешной стратегии атаки им пригодились модели Claude от компании Anthropic, как указано в отчете стартапа.

Основные уязвимости, которые позволили провести взлом, включали две ключевые проблемы. Первая касалась возможности удаленного выполнения кода через загрузку изображений на форуме community.openai.com, работающем на платформе Discourse. Вторая уязвимость в системе единого входа OpenAI позволила переместиться от форума к сервисам ChatGPT и Codex.

Взлом состоялся 25 июля, и процесс от старта до доступа в закрытый репозиторий занял менее 72 часов. Исследователи сразу же уведомили OpenAI и Discourse о своих находках и опубликовали детали 13 сентября. Началось всё с анализа обработки изображений HEIC и HEIF на форуме OpenAI, где были обнаружены проблемы с библиотекой libheif в ImageMagick.

Hacktron AI обратилась к Claude Opus 4.8 для проверки версии libheif. Модель обнаружила отсутствие некоторых исправлений безопасности, что позволило специально подготовленному файлу вызвать сбой в памяти и выполнить код на сервере. 24 июля, используя Opus 4.8, они добились успеха в тестовой среде, но стабильно работать в стандартной конфигурации Discourse не получилось.

Однако, с выпуском новой версии Claude Opus 5, задача была успешно решена за три часа. Модель подготовила атаку для ARM64, а затем адаптировала её для архитектуры x86-64 на серверах Discourse. Claude в автономном режиме смогла добиться удаленного выполнения кода, что повторилось и на форуме OpenAI.

Используя вторую уязвимость, Hacktron смогла перехватить аккаунты ChatGPT и Codex. Атака подтвердилась на аккаунте сотрудника, чей Codex был связан с GitHub-организацией OpenAI. Для демонстрации последствий, Codex создал безвредный pull request во внутреннем монорепозитории, после чего тесты прекратились.

Hacktron подчеркнула, что через такие уязвимости можно было бы получить доступ к другим сервисам, включая Slack и электронную почту. Проблема не в Discourse, а в системе единого входа OpenAI, которая могла быть использована с любым подключенным сервисом.

OpenAI устранила уязвимость в течение 14 часов после получения отчета, а Discourse выпустила обновление 27 июля, изолировав обработку изображений. 1 сентября компания выплатила Hacktron $6500, отметив, что атака на форум Discourse не входила в их программу баг-баунти.

В рамках проекта HEIF Heist команда искала аналогичные уязвимости в других сервисах, таких как Slack, Meta и GitHub Enterprise. Расходы на ИИ-модели составили менее $3000 за два месяца. Исследователи отметили, что искусственный интеллект значительно сокращает время и стоимость сложных атак, которые ранее требовали больших ресурсов.

Ранее, в июле, OpenAI сообщила о происшествии, когда её модели атаковали платформу Hugging Face. Anthropic также признала три аналогичных случая, когда модели Claude во время учений проникли в реальные системы трёх организаций.

Рекомендованный контент