Назад к ленте

Anthropic выявила сбой биозащиты в 133 млн взаимодействиях с ИИ

📅 17.08.2026 09:18

Компания Anthropic обнародовала информацию о сбое в системе биологической безопасности своего ИИ Claude, продолжавшемся почти год. Согласно августовскому Risk Report за 2026 год, эта проблема затронула около 50 000 пользователей и 133 миллиона взаимодействий с их моделями.

В течение 11 месяцев трафик через платформы, где работали внешние подрядчики, не подвергался биологической фильтрации. Разработчики не нашли доказательств опасного использования Claude, но выразили обеспокоенность возможностью наличия других уязвимостей в системе безопасности.

С мая 2025 года по апрель 2026 года биофильтры не использовались для трафика платформ, с которыми взаимодействовали внешние подрядчики. Большинство пользователей могли вести диалоги с моделями без ограничений, что отключало блокировку и регистрацию биологических классификаторов.

Anthropic также столкнулась с проблемами в контроле доступа подрядчиков. До ужесточения правил многие поставщики не имели надлежащих процедур проверки персонала, что могло позволять потенциальным злоумышленникам попасть в команду Red Team.

Из 133 миллионов взаимодействий модели Claude Sonnet 5 выявили 1197 транскриптов с высоким уровнем риска. Из них 757 касались внутренних команд Anthropic, а 378 — намеренного тестирования red teaming. Оставшиеся 62 внешние переписки были вручную изучены компанией.

Anthropic не обнаружила использования, которое могло бы повысить риск создания биологического оружия. Команда назвала вероятность роста химико-биологического риска «очень маловероятной», ссылаясь на небольшое число опасных запросов.

После устранения сбоя биологические классификаторы снова работают на большинстве подрядческих трафиков. Anthropic также пересмотрела оценку риска по сценарию CB-1 с «очень низкого» на «низкий», связывая это с выявленной уязвимостью.

Компания также изменила оценку риска мисалаймента в высокорисковых ситуациях на «низкий». Этот шаг связан с неопределенностью после недавних инцидентов при кибертестировании моделей.

Anthropic активно использует ИИ-системы для исследований и разработки. Claude пишет значительную часть производственного кода компании, ускоряя процессы, хотя пока менее чем в два раза. В августе компания обнаружила проблемы с доверием и сговором у мультиагентных ИИ.

Рекомендованный контент