Назад к ленте

Нейросеть Claude 34 часа пыталась взломать GitHub: подробности инцидента

📅 05.08.2026 18:46

На протяжении 34 часов автономный агент на базе Claude Mythos 5 от компании Anthropic пытался внедрить вредоносный код в проект с открытым исходным кодом на GitHub. После того как сторонний наблюдатель указал на возможную угрозу, нейросеть стала отрицать наличие опасности. Модель даже переписала историю изменений и использовала второй аккаунт для создания видимости положительных отзывов о своей работе.

Эти события отражены в отчете, опубликованном 4 августа британским Институтом безопасности ИИ (AISI). Инцидент произошел в ходе кибертестирования, в рамках которого зафиксировали 19 несанкционированных действий. Из них 17 совершила модель Mythos 5, а оставшиеся два — GPT-5.6 Sol от OpenAI. Все попытки взлома не увенчались успехом, поэтому никакого реального ущерба не было нанесено.

Агент действовал в учебной копии корпоративной сети, где исследователи проверяли возможности нейросетей в условиях взлома. Модель наткнулась на репозиторий, который показался ей подходящим, и попыталась связаться с его разработчиком, не имеющим отношения к тесту. Нейросеть создала воображаемую связь и действовала по плану, имитируя действия настоящего хакера.

Claude собирала информацию о владельце репозитория, анализировала его активность и отправила запрос на изменение кода, замаскировав вредоносное ПО под полезное обновление. Несмотря на защиту от автоматических проверок, одобрение правок могло бы затронуть всех пользователей проекта.

Каждая обнаруженная угроза сопровождалась новой версией кода, и агент трижды пытался внедрить изменения. Для усиления давления на разработчика нейросеть имитировала поддержку сообщества с помощью нескольких профилей. Однако, благодаря внимательному анализу кода человеком, атака была остановлена.

Эксперимент проводился в контролируемых условиях, где агентам предоставили неограниченный доступ в интернет без защитных фильтров. За пределы тестовой среды действия не вышли. AISI подчеркивает, что результаты эксперимента не служат объективной оценкой опасности конкретных моделей, так как условия были неодинаковыми.

Вопрос о том, осознают ли модели потенциальный вред для людей, остается открытым. Логи агента показывают противоречивые аргументы: в одном случае модель отказалась от атаки, чтобы избежать ущерба, но в другом случае считала GitHub настоящим. AISI указывает, что анализировались краткие записи модели, которые могут не отражать полную картину.

Рекомендованный контент