Назад к ленте

Anthropic выявила масштабные проблемы биозащиты в 133 млн взаимодействий с ИИ

📅 17.08.2026 15:50

В недавнем отчете Anthropic раскрыла почти годичный сбой в системе биологической безопасности своей ИИ-модели Claude. Поскольку проблема коснулась около 50 000 пользователей и 133 миллионов взаимодействий, это привлекло внимание специалистов. В документе, озаглавленном Risk Report за август 2026 года, указывается, что сбоем были затронуты платформы, через которые внешние подрядчики взаимодействовали с моделями компании.

На протяжении 11 месяцев трафик этих платформ обходил биологические классификаторы, что вызвало обеспокоенность у разработчиков. После проверки выяснилось, что опасного использования системы не зафиксировано, но компания признала снижение уверенности в своих защитных системах. Это заставило их задуматься о возможном наличии других невыявленных уязвимостей.

С мая 2025 до апреля 2026 года биологические фильтры не применялись на платформах, где внешние подрядчики оценивали и тестировали модели. В большинстве случаев пользователи могли вести открытые диалоги с моделями, что приводило к отключению блокирующих функций классификаторов. Это означало, что потенциально опасные обращения не блокировались и не фиксировались для последующей проверки.

Anthropic также указала на проблемы с контролем доступа у подрядчиков. До введения более строгих мер многие поставщики не имели надежных процедур проверки, что могло позволить злоумышленникам легко попасть в команду Red Team. Анализ 133 миллионов взаимодействий выделил 1197 потенциально опасных случаев, большинство из которых касались внутреннего использования и тестирования.

Из оставшихся случаев Anthropic вручную изучила 62 внешние переписки. Проведенная проверка не выявила признаков использования, способного существенно увеличить риск создания биологического оружия. Несмотря на это, инцидент повысил оценку риска существования других уязвимостей в системах компании.

После обнаружения ошибки Anthropic усилила защитные меры и пересмотрела свои рисковые оценки, что отразилось на сценарии CB-1. Ранее риск оценивался как «очень низкий», но после инцидента его пересмотрели до «низкого». Эти изменения связаны с дополнительной неопределенностью после выявленных сбоев в работе классификаторов.

Кроме того, компания изменила оценку риска мисалаймента в высокорисковых ситуациях с «очень низкой» до «низкой». Этот шаг обусловлен неопределенностью, возникшей после недавних кибертестов моделей. В отчете также подчеркивается, что Claude активно участвует в создании кода для компании, ускоряя внутренние разработки.

Рекомендованный контент