Anthropic ужесточает контроль над ИИ: новая система оценки «джейлбрейков» и ее последствия

Anthropic ужесточает контроль над ИИ: новая система оценки «джейлбрейков» и ее последствия
 

Компания Anthropic раскрыла детали своей новой системы защиты моделей Fable 5, а также представила Cyber Jailbreak Severity (CJS) — методику оценки опасности успешных обходов защитных механизмов ИИ. Фактически речь идет о попытке создать единый стандарт, который позволит определять, насколько серьезной является та или иная уязвимость модели и какие меры следует принимать.

Одновременно компания подробно описала логику работы классификаторов безопасности, которые анализируют запросы пользователей. Все запросы, связанные с кибербезопасностью, делятся на четыре категории: от заведомо вредоносных (например, создание программ-вымогателей или инструментов для кражи данных), которые блокируются безусловно, до полностью безопасных задач вроде анализа журналов, отладки кода и написания безопасного программного обеспечения.

Между ними находятся две категории «двойного назначения», включающие пентест, поиск уязвимостей и исследовательские задачи. Именно здесь, по признанию Anthropic, чаще всего возникают ложные срабатывания: безопасные запросы могут ошибочно восприниматься как потенциально опасные.

Новая система CJS оценивает не сам факт обхода защиты, а его практическую опасность. При расчете учитываются четыре параметра: насколько обход увеличивает возможности злоумышленника, насколько широк круг потенциальных атак, насколько легко превратить полученные результаты в реальный инструмент атаки и насколько доступна сама техника обхода. По суммарному баллу инцидент получает рейтинг от CJS-0 до CJS-4 — от практически безвредного случая до критической угрозы, требующей самых жестких мер.

Особенность подхода заключается в том, что оценка зависит от контекста. Один и тот же сценарий может считаться крайне опасным в момент обнаружения новой критической уязвимости, но спустя несколько лет, когда информация уже широко известна, получить минимальный рейтинг. Таким образом, система оценивает не абсолютную опасность, а дополнительный риск, который создает конкретный обход защиты в конкретный момент времени.

Появление CJS связано не только с техническими вопросами безопасности, но и с усилением государственного контроля над передовыми ИИ-моделями. В частности, ограничения США, которые впервые распространились не только на аппаратное обеспечение и веса моделей, но и на доступ к API. На этом фоне CJS может стать инструментом, который позволит формализовать решения о введении дополнительных ограничений или даже временном отключении доступа к отдельным моделям.

Для пользователей это означает, что взаимодействие с современными ИИ становится более чувствительным к формулировкам запросов. Даже легитимные задачи в области информационной безопасности могут попадать под действие защитных механизмов, а разработчикам и исследователям, вероятно, придется тщательнее формулировать запросы, чтобы избежать ошибочных блокировок. В Anthropic заявляют, что планируют совершенствовать систему, однако сроки снижения количества ложных срабатываний пока не называются.

БОЛЬШЕ ИНФОРМАЦИИ

Email

sms_systems@inbox.ru

Телефон

+ 7 (985) 982-70-55

Если у вас есть инновационная идея, мы будем рады реализовать ее для Вас!

Специалисты нашей кампании и наши разработки для вас!