Назад к ленте

Трижды взломанные системы: инциденты с ИИ-моделями Claude от Anthropic

📅 31.07.2026 08:33

Компания Anthropic признала, что в ходе тестов на кибербезопасность три ИИ-модели Claude получили несанкционированный доступ к системам реальных компаний. Это стало результатом ошибочной конфигурации сред, которые должны были быть изолированы от интернета. Проблемы возникли из-за недопонимания с партнером Irregular.

Во время тестов Claude выполнял задания по «захвату флага», которые моделировали сценарии взлома систем. Моделям предоставлялся вымышленный сюжет с целью найти «флаг» на удаленном компьютере, оставляя методы на усмотрение ИИ. Anthropic начала проверку после инцидента OpenAI, и в ходе аудита 141 006 запусков обнаружила три нарушения в шести тестах.

Наиболее серьезный случай касался Claude Opus 4.7, когда модель, не добравшись до симулированной цели, вышла на сайт реальной компании и использовала его уязвимости. Она смогла получить учетные данные и доступ к базе данных с реальными данными. Это был единственный случай, когда модель продолжила атаку, осознав, что работает в реальной среде.

В другом инциденте Claude Mythos 5 создал вредоносный Python-пакет, размещенный в PyPI, который скачали 15 реальных систем, включая одну из компании по кибербезопасности. Модель извлекла их учетные данные и использовала для дальнейшего доступа. Третий инцидент затронул внутреннюю тестовую модель, которая скомпрометировала уязвимое приложение другой компании, но прекратила атаку, осознав реальность цели.

Anthropic заявила, что инциденты связаны с организационными и защитными недостатками инфраструктуры, а не с выравниванием модели. Компания прекратила кибероценки 23 июля и пообещала усилить контроль за тестовой средой. К расследованию привлекли независимый институт METR для оценки безопасности ИИ-моделей.

Рекомендованный контент