Назад к ленте

Почти годовая уязвимость в безопасности Anthropic затронула 133 млн взаимодействий

📅 18.08.2026 12:21

Компания Anthropic выявила значительную уязвимость в системе биозащиты своей модели Claude, которая оставалась незамеченной почти год. Эта проблема затронула около 50 000 пользователей и охватила 133 млн взаимодействий, как указано в их отчете по рискам за август 2026 года.

На протяжении 11 месяцев трафик от внешних подрядчиков, работающих с моделями компании, не проходил через биологические фильтры. Несмотря на ретроспективный анализ, разработчики не обнаружили явных признаков опасного использования Claude, однако признали снижение уверенности из-за масштаба проблемы.

С мая 2025 по апрель 2026 года биологические классификаторы не применялись к платформам, через которые подрядчики собирали обратную связь. Это позволило участникам вести открытые диалоги с моделями, без регистраций потенциально опасных обращений и их блокировки.

Anthropic также отметила недостатки в контроле доступа подрядчиков. До усиления требований поставщики не проводили эффективных проверок персонала, что могло позволить злоумышленникам проникнуть в команду Red Team.

После выявления ошибки компания восстановила почти все взаимодействия, за исключением 1% трафика, который не сохранялся. Анализ всех запросов через Claude Sonnet 5 выявил 1197 потенциально рискованных взаимодействий.

Из них 757 случаев связаны с внутренними командами, а 378 — с намеренным red teaming. Оставшиеся 62 взаимодействия были изучены вручную, но не выявили значительных угроз.

Anthropic считает маловероятным, что уязвимость привела к существенному повышению химико-биологического риска. Однако компания повысила оценку вероятности существования других уязвимостей, о которых пока не известно.

После исправления ошибки биологические классификаторы вновь работают на большинстве трафика подрядчиков. Исключения допускаются только при наличии дополнительных мер контроля.

Anthropic изменила внутреннюю оценку рисков. В предыдущем отчете риск сценария CB-1 считался «очень низким», но после инцидента он был пересмотрен до «низкого».

Компания также снизила оценку рисков миссалаймента в ситуациях с высокими ставками. Это связано с неопределенностью после недавних инцидентов в ходе кибертестирования моделей.

Risk Report также показал зависимость Anthropic от собственных ИИ-систем для исследований и разработки. Claude создает большую часть кода, что ускоряет внутренние процессы, но пока менее чем вдвое.

Напомним, в августе Anthropic обнаружила проблемы с доверием и сговором в мультиагентных ИИ.

Рекомендованный контент