Назад к ленте

Исследователи Hacktron AI взломали OpenAI с помощью ИИ-моделей Claude

📅 18.09.2026 13:02

В результате успешной атаки, исследователи из Hacktron AI получили доступ к внутренним ресурсам OpenAI, используя аккаунт сотрудника компании. Для разработки стратегии взлома они обратились к возможностям модели Claude от компании Anthropic, как сообщается в отчете стартапа.

Эксперты выявили две уязвимости: первая позволяла выполнение кода через загрузку изображений на форуме community.openai.com, работающем на платформе Discourse. Вторая уязвимость касалась системы единого входа OpenAI, что облегчало доступ к ChatGPT и Codex через скомпрометированный форум.

25 июля специалисты провели атаку, завершив весь процесс от исследования до получения доступа к репозиторию менее чем за 72 часа. Они сообщили OpenAI и Discourse о проблеме в тот же день, а подробности обнародовали 13 сентября.

Исследование началось с анализа обработки файлов HEIC и HEIF на форуме OpenAI, которые передавались ImageMagick через библиотеку libheif. Hacktron AI поручила модели Claude Opus 4.8 проверить версию libheif, и модель выявила отсутствие критических исправлений безопасности.

24 июля, используя Opus 4.8, исследователи разработали атаку в тестовой среде без ASLR-защиты. Однако стабильно она не работала в стандартной конфигурации. Вечером Anthropic выпустила обновленную модель Claude Opus 5, которая за три часа создала рабочую версию атаки для ARM64, затем адаптировала ее для x86-64 и серверов Discourse.

Claude в автономном режиме успешно выполнила код на собственном экземпляре Discourse Cloud. Вскоре та же методика была применена на форуме OpenAI, предоставив Hacktron доступ к аккаунту сотрудника.

После захвата форума Hacktron использовала вторую уязвимость для захвата аккаунтов ChatGPT и Codex у пользователей, входивших на форум через учетную запись OpenAI. Атака была подтверждена на аккаунте сотрудника, чей Codex был связан с GitHub OpenAI.

Hacktron продемонстрировала последствия атаки, создав безвредный pull request во внутреннем репозитории OpenAI. Исследователи прекратили тестирование, отметив, что через скомпрометированные аккаунты можно было получить доступ и к другим сервисам.

OpenAI устранила уязвимость примерно через 14 часов после получения отчета, а Discourse представила исправление 27 июля. 1 сентября OpenAI вознаградила исследователей суммой $6500, отметив, что атака на Discourse форум не входила в программу bug bounty.

Команда Hacktron подчеркивает, что ИИ сокращает время и затраты на сложные атаки, которые ранее требовали крупных команд и месяцев работы. Процесс взлома не был полностью автономным, и модели нуждались в руководстве экспертов.

В рамках проекта HEIF Heist команда изучала использование библиотеки libheif в других сервисах, таких как Slack, Meta и GitHub Enterprise, потратив менее $3000 за два месяца. Исследователи полагают, что ИИ значительно упрощает проведение сложных атак.

Рекомендованный контент