Anthropic выявила сбой биозащиты в 133 млн взаимодействиях с ИИ
Компания Anthropic обнародовала информацию о сбое в системе биологической безопасности своего ИИ Claude, продолжавшемся почти год. Согласно августовскому Risk Report за 2026 год, эта проблема затронула около 50 000 пользователей и 133 миллиона взаимодействий с их моделями.
В течение 11 месяцев трафик через платформы, где работали внешние подрядчики, не подвергался биологической фильтрации. Разработчики не нашли доказательств опасного использования Claude, но выразили обеспокоенность возможностью наличия других уязвимостей в системе безопасности.
С мая 2025 года по апрель 2026 года биофильтры не использовались для трафика платформ, с которыми взаимодействовали внешние подрядчики. Большинство пользователей могли вести диалоги с моделями без ограничений, что отключало блокировку и регистрацию биологических классификаторов.
Anthropic также столкнулась с проблемами в контроле доступа подрядчиков. До ужесточения правил многие поставщики не имели надлежащих процедур проверки персонала, что могло позволять потенциальным злоумышленникам попасть в команду Red Team.
Из 133 миллионов взаимодействий модели Claude Sonnet 5 выявили 1197 транскриптов с высоким уровнем риска. Из них 757 касались внутренних команд Anthropic, а 378 — намеренного тестирования red teaming. Оставшиеся 62 внешние переписки были вручную изучены компанией.
Anthropic не обнаружила использования, которое могло бы повысить риск создания биологического оружия. Команда назвала вероятность роста химико-биологического риска «очень маловероятной», ссылаясь на небольшое число опасных запросов.
После устранения сбоя биологические классификаторы снова работают на большинстве подрядческих трафиков. Anthropic также пересмотрела оценку риска по сценарию CB-1 с «очень низкого» на «низкий», связывая это с выявленной уязвимостью.
Компания также изменила оценку риска мисалаймента в высокорисковых ситуациях на «низкий». Этот шаг связан с неопределенностью после недавних инцидентов при кибертестировании моделей.
Anthropic активно использует ИИ-системы для исследований и разработки. Claude пишет значительную часть производственного кода компании, ускоряя процессы, хотя пока менее чем в два раза. В августе компания обнаружила проблемы с доверием и сговором у мультиагентных ИИ.