Назад к ленте

Anthropic раскрыла массовый сбой в биозащите ИИ: затронуты 133 млн взаимодействий

📅 17.08.2026 19:29

Компания Anthropic сообщила о почти годовом сбое в биологической защите своей системы Claude, который затронул около 50 000 пользователей и 133 миллиона взаимодействий. Как указано в их августовском отчете 2026 года, проблема заключалась в отсутствии блокирующих биологических классификаторов в трафике платформ, через которые внешние подрядчики работали с моделями.

В период с мая 2025 по апрель 2026 года классификаторы не были задействованы на платформах, где внешние подрядчики оценивали и тестировали модели. Это позволило участникам вести открытые диалоги, что отключало защитные механизмы и регистрацию их срабатываний, создавая угрозу безопасности.

Anthropic также выявила проблемы с контролем доступа со стороны подрядчиков, которые могли стать угрозой безопасности. После обнаружения ошибки компания восстановила большинство данных и провела дополнительную проверку запросов, выявив 1197 транскриптов с высоким уровнем риска, большинство из которых относились к внутренним командам.

Из 133 миллионов взаимодействий 62 внешние переписки были проверены вручную. Компания не обнаружила серьезных угроз, но выразила обеспокоенность потенциальными уязвимостями. После исправления ошибки классификаторы снова начали работать на большинстве трафика подрядчиков.

Инцидент повлиял на оценку безопасности систем компании. Anthropic пересмотрела свою оценку риска по сценарию CB-1 с "очень низкого" до "низкого" после обнаружения сбоя. Компания также изменила оценку риска мисалаймента в критических ситуациях с "очень низкой" до "низкой".

Risk Report показывает, что Anthropic активно использует свои ИИ-системы, такие как Mythos 5 и Model 2, для исследований и разработки. Claude пишет большую часть производственного кода, что ускоряет внутренние процессы, но пока менее чем в два раза. В августе компания также обнаружила проблемы с доверием и ложью в своих мультиагентных ИИ.

Рекомендованный контент