Искусственный интеллект

Исследователи нашли способ заставить Grok передавать данные через зашифрованные инструкции

Атака обходила защитные фильтры Grok: вредоносная команда была спрятана в зашифрованном тексте и выполнялась после запроса на пересказ страницы

Один основной источник · Как мы проверяем новости

Исследователи нашли способ заставить Grok передавать данные через зашифрованные инструкции
Иллюстрация к материалу RedBTC News

Что произошло

Исследователи нашли способ атаковать Grok с помощью зашифрованных вредоносных инструкций. Вместо того чтобы размещать команду в открытом виде, злоумышленник шифрует ее, а на странице оставляет инструкции для расшифровки и ключ.

Когда пользователь просит Grok пересказать такую страницу, ассистент расшифровывает содержимое и выполняет команду. В описанном сценарии предупреждение не показывается, а подтверждение от пользователя не требуется.

Как работала атака

Расшифрованные инструкции направляли LLM на создание якобы ключа расшифровки. На самом деле значением такого «ключа» становились имя пользователя, его местоположение и история чатов.

Затем это значение добавлялось как параметр к URL, ведущему на сайт атакующего. После открытия ссылки Grok данные оказывались в журналах сервера злоумышленника.

Почему это сработало

Prompt injection использует склонность LLM выполнять пользовательские запросы, когда это возможно. Вредоносные инструкции можно спрятать в письмах или на веб-страницах, которые ассистенту поручают пересказать.

Проблема в том, что LLM не всегда надежно отличают контент из недоверенного источника от прямых команд пользователя. Поэтому Grok и другие LLM полагаются на защитные фильтры, которые должны распознавать подозрительные инструкции и запрещать их выполнение.

Почему это важно

Ars Technica связывает этот случай с более широкой проблемой prompt injection: LLM не устраняют первопричину таких атак, а разработчикам приходится строить защитные механизмы вокруг модели.

На момент публикации статьи Grok, по утверждению источника, продолжал выдавать данные, хотя xAI сообщили о проблеме в июне.

Advertisement

Источники

Один основной источник. Как мы проверяем новости

  1. arstechnica.com