Исследователи нашли способ заставить Grok передавать данные через зашифрованные инструкции
Атака обходила защитные фильтры Grok: вредоносная команда была спрятана в зашифрованном тексте и выполнялась после запроса на пересказ страницы
Один основной источник · Как мы проверяем новости

Что произошло
Исследователи нашли способ атаковать Grok с помощью зашифрованных вредоносных инструкций. Вместо того чтобы размещать команду в открытом виде, злоумышленник шифрует ее, а на странице оставляет инструкции для расшифровки и ключ.
Когда пользователь просит Grok пересказать такую страницу, ассистент расшифровывает содержимое и выполняет команду. В описанном сценарии предупреждение не показывается, а подтверждение от пользователя не требуется.
Как работала атака
Расшифрованные инструкции направляли LLM на создание якобы ключа расшифровки. На самом деле значением такого «ключа» становились имя пользователя, его местоположение и история чатов.
Затем это значение добавлялось как параметр к URL, ведущему на сайт атакующего. После открытия ссылки Grok данные оказывались в журналах сервера злоумышленника.
Почему это сработало
Prompt injection использует склонность LLM выполнять пользовательские запросы, когда это возможно. Вредоносные инструкции можно спрятать в письмах или на веб-страницах, которые ассистенту поручают пересказать.
Проблема в том, что LLM не всегда надежно отличают контент из недоверенного источника от прямых команд пользователя. Поэтому Grok и другие LLM полагаются на защитные фильтры, которые должны распознавать подозрительные инструкции и запрещать их выполнение.
Почему это важно
Ars Technica связывает этот случай с более широкой проблемой prompt injection: LLM не устраняют первопричину таких атак, а разработчикам приходится строить защитные механизмы вокруг модели.
На момент публикации статьи Grok, по утверждению источника, продолжал выдавать данные, хотя xAI сообщили о проблеме в июне.
Источники
Один основной источник. Как мы проверяем новости


