Искусственный интеллект

Защитные ограничения AI мешают исследователям кибербезопасности

TechCrunch описал конфликт вокруг guardrails в AI-моделях: меры против злоумышленников могут блокировать легитимную работу защитников сетей и специалистов по offensive cybersecurity

Один основной источник · Как мы проверяем новости

Защитные ограничения AI мешают исследователям кибербезопасности
Иллюстрация к материалу RedBTC News

Что произошло

TechCrunch поговорил с несколькими специалистами по offensive cybersecurity о том, как guardrails в AI-моделях влияют на их работу. По словам собеседников издания, ограничения, созданные для защиты от вредоносного использования, могут мешать легитимным исследованиям и работе защитников сетей.

Проблема особенно заметна для тех, кто ищет неизвестные уязвимости и разрабатывает способы их эксплуатации раньше преступников. Такие специалисты критикуют guardrails за то, что модели могут отказываться отвечать на запросы, необходимые для проверки уязвимостей.

Как компании ограничивают доступ

Anthropic и OpenAI предлагают исследователям специальные программы, через которые можно пройти проверку и, в случае одобрения, получить доступ к моделям с меньшим числом кибербезопасностных ограничений. У OpenAI такая программа называется Trusted Access for Cyber, у Anthropic — Cyber Verification Program.

В материале также упоминаются модели Anthropic Mythos и Fable. В июне правительство США ввело экспортные ограничения на эти модели, частично из-за отчета о возможности обхода guardrails, которые должны были предотвращать создание и выполнение вредоносных кибератак.

Позднее экспортные ограничения на Fable 5 и Mythos 5 были сняты. Fable 5 вернулась в общий доступ 1 июля, а Mythos 5 была вновь доступна только проверенным организациям США в рамках правительственного процесса пересмотра.

Почему это важно

Главный спор в том, что один и тот же запрос к AI-модели может быть как полезным для защиты, так и потенциально опасным. Chris Anley, главный научный сотрудник NCC Group, сказал, что просьба к модели попробовать эксплуатировать баг помогает подтвердить, что уязвимость действительно существует и ее нужно исправить.

Anley отметил, что если guardrail заставляет модель полностью отказаться от ответа, это вредит защитникам. По его словам, запрос вроде «исправь этот код» одновременно может быть механизмом защиты и дорожной картой для поиска критических уязвимостей в кодовой базе.

Контекст

Известный исследователь безопасности Mark Dowd раскритиковал ситуацию, при которой крупные компании сами решают, что считать безопасным в области кибербезопасности. Он также признал, что его работа может влиять на его позицию.

Dowd десятилетиями занимался поиском и продажей zero days западным правительствам, а не передачей информации разработчикам для исправления. В материале отмечается, что правительства готовы платить больше за уязвимости именно потому, что они остаются открытыми и могут быть полезны для разведывательных операций.

Источники

Один основной источник. Как мы проверяем новости

  1. techcrunch.com