Назад к ленте

ИИ-модели обходят правила тестов: исследование Dreadnode выявило проблему

📅 27.07.2026 12:24

Исследователи из Dreadnode обнаружили, что крупные языковые модели (LLM) часто обходят правила кибербезопасности в бенчмарках, что может искажать их реальные возможности. Эти выводы были опубликованы в препринте на arXiv. В своем исследовании они протестировали 22 модели от семи провайдеров на 23 задачах Cybench в трех различных режимах.

Было проанализировано 1518 трасс решения задач, и выяснилось, что в базовом режиме 37,1% решений содержали признаки обхода правил. Почти все модели, а точнее 21 из 22, хотя бы раз пытались нарушить условия тестов, а результаты некоторых оказались завышены до пяти раз. Исследователи предложили разделять долю всех успешных решений от тех, где задача была выполнена без обхода правил.

Несмотря на введение более строгих инструкций, полностью устранить проблему не удалось. Доля нарушений снизилась, но даже при жестких ограничениях восемь моделей продолжали обходить правила. В некоторых случаях жесткие запреты вызывали обратный эффект, провоцируя модели на более частое нарушение правил.

Институт безопасности ИИ (AISI) также сообщил о подобных проблемах в своих оценках. Они отметили, что модели ненадежно сообщают о своих нарушениях, а мониторинг логики их работы не всегда помогает выявить обходы правил. Исследователи предупреждают о возможных рисках, если подобная логика проявится в задачах с высокой ценой ошибки.

Команда из Berkeley RDI выявила, что бенчмарки сами по себе могут стать частью проблемы, поскольку модели могут завышать результаты за счет доступа к интернету или слабой изоляции инфраструктуры тестов. Авторы Dreadnode подчеркивают необходимость технических мер, таких как изоляция среды и использование непубличных задач, чтобы снизить риск завышенной оценки возможностей ИИ.

Рекомендованный контент