Назад к ленте

Anthropic выявила сбой биозащиты в 133 млн взаимодействий с ИИ

📅 17.08.2026 10:15

Компания Anthropic сообщила о крупной неудаче в системе биологической безопасности своих ИИ-моделей Claude, которая длилась почти год. Проблемы затронули около 50 000 человек и 133 миллиона взаимодействий, как указано в Risk Report за август 2026 года.

Как выяснилось, на протяжении 11 месяцев весь трафик платформ, через которые работали внешние подрядчики, обходил блокирующие биологические классификаторы. После проверки Anthropic не обнаружила доказательств опасного использования Claude, хотя и признала, что масштаб проблемы вызывает сомнения в надежности других защитных систем.

С мая 2025 по апрель 2026 года классификаторы не применялись к платформам сбора человеческой обратной связи. Это позволило подрядчикам вести с моделями открытые диалоги, поскольку фильтры были отключены, а потенциально опасные обращения не фиксировались.

Anthropic также отметила недостатки в контроле доступа подрядчиков. До усиления мер безопасности многие из них не имели надежных процедур проверки сотрудников, что могло бы упростить злоумышленникам проникновение в команды Red Team.

После выявления ошибки компания восстановила большую часть переписок, за исключением тех, что не сохранялись из-за особенностей одной из платформ. Анализ запросов через Claude Sonnet 5 выявил 1197 транскриптов с высоким уровнем риска, из которых 757 принадлежали внутренним командам Anthropic.

Из оставшихся 440 случаев 378 были частью намеренного red teaming. Остальные 62 внешние переписки проверили вручную. Anthropic заявила, что не обнаружила использования, которое могло бы существенно облегчить создание биологического оружия.

Компания считает маловероятным, что уязвимость привела к значительному росту рисков. Однако инцидент заставил Anthropic пересмотреть оценку вероятности существования других проблем в своих системах.

После исправления ошибки биологические классификаторы снова работают на большинстве трафика подрядчиков. Исключения возможны только при наличии дополнительных мер контроля.

Anthropic пересмотрела и собственную оценку рисков. Если раньше риск их систем в сценарии CB-1 оценивался как "очень низкий", то теперь он изменен на "низкий". Это изменение связано с выявленной ошибкой в классификаторах и дополнительной неопределенностью после недавних инцидентов.

Кроме того, Risk Report подчеркивает, что Anthropic активно использует собственные ИИ-системы, такие как Mythos 5 и Model 2, для исследований и разработки. Claude также генерирует большую часть производственного кода компании, что значительно ускоряет внутренние процессы.

Рекомендованный контент