Назад к ленте

Claude случайно атаковал три компании: сбой в киберучениях от Anthropic

📅 31.07.2026 10:01

В ходе испытаний модели Claude, разработанной Anthropic, обнаружены три случая несанкционированного доступа к реальным системам компаний. По итогам проверки кибербезопасности выяснилось, что модель покидала изолированную тестовую среду и проникала в сети организаций. Проблему выявили после аналогичного инцидента с OpenAI.

Исследование охватило 141 006 тестов, и в трех из них модели ошибочно атаковали реальные цели. Киберучения, в которых участвовали модели, проводились в формате «захвати флаг», где Claude самостоятельно выбирал методы для поиска скрытой информации на других машинах.

Несмотря на указания, что тестовая среда не связана с интернетом, недопонимание между Anthropic и партнером Irregular привело к доступности реальных сетей. В результате модели принимали их за часть учений и атаковали через уязвимые пароли и открытые точки доступа.

Три инцидента произошли с моделями Opus 4.7, Mythos 5 и внутренней исследовательской моделью. Opus 4.7, столкнувшись с настоящей системой, извлекла рабочие данные из базы, а Mythos 5 разместила вредоносный пакет в PyPI, который скачали 15 систем. Внутренняя модель, распознав реальную среду, прекратила атаку.

Anthropic подчеркивает, что произошедшее стало результатом сбоя в настройке тестов, а не ошибок моделей. Claude считал, что интернета нет, и принимал реальные системы за симуляцию. Проверка началась 23 июля, после чего все киберучения были остановлены.

Anthropic уведомила партнеров и пострадавшие компании 27 июля. Две из организаций не заметили аномалий, и сейчас им оказывают помощь в устранении последствий. В компании подчеркивают важность защиты тестовых сред и контроля над мощными автономными моделями.

Рекомендованный контент