Искусственный интеллект

Водяные знаки SynthID-Text могут ослаблять защиту ИИ-моделей

Исследование показало, что водяная маркировка SynthID-Text способна менять не только выбор слов, но и реакцию моделей на вредоносные запросы и вызовы инструментов

Один основной источник · Как мы проверяем новости

Водяные знаки SynthID-Text могут ослаблять защиту ИИ-моделей
Иллюстрация к материалу RedBTC News

Что произошло

Новое исследование показало, что SynthID-Text способен менять не только выбор слов языковой моделью, но и вероятность соблюдения ею защитных ограничений. В отдельных случаях после внедрения маркировки модели выполняли вредоносные инструкции, от которых без нее отказывались.

Эффект оказался заметнее, когда вредоносные запросы сочетались с атаками на внедрение запросов. Такие атаки направлены на то, чтобы заставить модель выполнить опасное действие, например раскрыть пароль или другие чувствительные сведения.

Как работает SynthID-Text

Anthropic сообщила, что будущие модели Claude будут использовать SynthID-Text — разработанный Google и опубликованный с открытым исходным кодом подход к маркировке текста.

Технология встраивает в результат сигнал, по которому можно определить его происхождение. Вместо обычного генератора случайных чисел для выбора следующего слова используется секретный ключ. Сам выбор остается случайным, но знающие ключ могут проверить последовательность слов и оценить вероятность применения этого ключа.

Одна из особенностей SynthID — турнирная выборка. Система оценивает большое число кандидатов на следующий токен, присваивает им скрытые вероятностные оценки, а затем сравнивает пары кандидатов до определения итогового токена.

Почему это важно

Изменения могут затрагивать не только текстовые ответы. В ИИ-агентах сгенерированные токены определяют, какой инструмент будет вызван и какие аргументы ему передадут. Поэтому ослабление отказа от вредоносного запроса может привести к более серьезным последствиям, если модель способна действовать через инструменты.

Исследователь Andrea Siposova из Lasso Security отметила, что водяная маркировка меняет поведение моделей, особенно в условиях атак и при вызове инструментов агентом.

Контекст

ИИ-платформы внедряют новые схемы водяной маркировки в ответ на новый закон Европейского союза. Маркировка должна быть незаметной для читателя, однако любое изменение процесса генерации может приводить к побочным эффектам.

В описанном эксперименте Siposova проверила конфигурацию SynthID-Text без искажения текста с помощью неизмененного инструмента SynthIDTextWatermarkLogitsProcessor из Hugging Face и сравнила ответы моделей на вредоносные запросы при наличии и отсутствии маркировки.

Advertisement

Источники

Один основной источник. Как мы проверяем новости

  1. arstechnica.com