Компания Anthropic раскрыла детали своей новой системы защиты моделей Fable 5, а также представила Cyber Jailbreak Severity (CJS) — методику оценки опасности успешных обходов защитных механизмов ИИ. Фактически речь идет о попытке создать единый стандарт, который позволит определять, насколько серьезной является та или иная уязвимость модели и какие меры следует принимать.
Одновременно компания подробно описала логику работы классификаторов безопасности, которые анализируют запросы пользователей. Все запросы, связанные с кибербезопасностью, делятся на четыре категории: от заведомо вредоносных (например, создание программ-вымогателей или инструментов для кражи данных), которые блокируются безусловно, до полностью безопасных задач вроде анализа журналов, отладки кода и написания безопасного программного обеспечения.
Между ними находятся две категории «двойного назначения», включающие пентест, поиск уязвимостей и исследовательские задачи. Именно здесь, по признанию Anthropic, чаще всего возникают ложные срабатывания: безопасные запросы могут ошибочно восприниматься как потенциально опасные.
Новая система CJS оценивает не сам факт обхода защиты, а его практическую опасность. При расчете учитываются четыре параметра: насколько обход увеличивает возможности злоумышленника, насколько широк круг потенциальных атак, насколько легко превратить полученные результаты в реальный инструмент атаки и насколько доступна сама техника обхода. По суммарному баллу инцидент получает рейтинг от CJS-0 до CJS-4 — от практически безвредного случая до критической угрозы, требующей самых жестких мер.
Особенность подхода заключается в том, что оценка зависит от контекста. Один и тот же сценарий может считаться крайне опасным в момент обнаружения новой критической уязвимости, но спустя несколько лет, когда информация уже широко известна, получить минимальный рейтинг. Таким образом, система оценивает не абсолютную опасность, а дополнительный риск, который создает конкретный обход защиты в конкретный момент времени.
Появление CJS связано не только с техническими вопросами безопасности, но и с усилением государственного контроля над передовыми ИИ-моделями. В частности, ограничения США, которые впервые распространились не только на аппаратное обеспечение и веса моделей, но и на доступ к API. На этом фоне CJS может стать инструментом, который позволит формализовать решения о введении дополнительных ограничений или даже временном отключении доступа к отдельным моделям.
Для пользователей это означает, что взаимодействие с современными ИИ становится более чувствительным к формулировкам запросов. Даже легитимные задачи в области информационной безопасности могут попадать под действие защитных механизмов, а разработчикам и исследователям, вероятно, придется тщательнее формулировать запросы, чтобы избежать ошибочных блокировок. В Anthropic заявляют, что планируют совершенствовать систему, однако сроки снижения количества ложных срабатываний пока не называются.
sms_systems@inbox.ru
+ 7 (985) 982-70-55