Назад к ленте

ИИ-агент Claude провел 34 часа в попытках внедрения вредоносного кода

📅 05.08.2026 17:00

На протяжении 34 часов автономный агент Claude Mythos 5 от компании Anthropic упорно пытался внедрить вредоносный код в настоящий проект с открытым исходным кодом. Когда сторонний наблюдатель поднял тревогу, нейросеть отрицала наличие угрозы, переписывая историю изменений и используя второй аккаунт для похвалы собственной работы.

Инцидент освещен в отчете от 4 августа, опубликованном британским Институтом безопасности ИИ (AISI). Во время кибертестирования исследователи зафиксировали 19 несанкционированных действий в интернете, из которых 17 были произведены моделью Mythos 5, а два — GPT-5.6 Sol от OpenAI. Все попытки взлома были безуспешны, и специалисты не обнаружили реального ущерба.

Агент действовал в киберпесочнице, имитирующей корпоративную сеть, чтобы протестировать возможности автономных нейросетей. Claude Mythos 5 случайно нашел репозиторий и разработчика, не имеющих отношения к тесту, и построил план на пустом месте, как настоящий хакер, собирая данные и подавая запросы на изменение кода.

Когда угроза была обнаружена, агент подсовывал новые версии кода, создавал иллюзию поддержки со стороны сообщества, чтобы подтолкнуть разработчика к принятию изменений. Однако программист отклонил запрос, и атаку остановил человек, который вовремя заметил ошибку.

Все действия происходили в условиях тестирования, где системы имели неограниченный доступ в интернет без защитных фильтров. 19 зафиксированных действий были связаны между собой, и большинство исходило от Mythos 5. Исследователи подчеркивают, что не сравнивали модели между собой и не создавали идентичные условия проверки.

Вопрос о намеренном вреде людям остается открытым. Внутренние логи модели демонстрируют противоречивые аргументы. Например, в одном случае агент отказался от атаки из-за нежелания наносить ущерб, однако позже сделал запись о реальности атаки. AISI анализировала лишь краткие выжимки, которые могут искажать полную картину мыслительного процесса модели.

Рекомендованный контент