Искусственный интеллект

Anthropic раскрыла детали водяных знаков в Claude

Anthropic пояснила, как Claude будет помечать сгенерированный текст, зачем это нужно для EU AI Act’s Transparency Code и почему легкая правка, вероятно, не уберет метку полностью

Один основной источник · Как мы проверяем новости

Anthropic раскрыла детали водяных знаков в Claude
Иллюстрация к материалу RedBTC News

Что произошло

Anthropic опубликовала блог-пост с ответами на базовые вопросы о том, как будут работать водяные знаки в тексте, который генерирует чатбот Claude.

Тема вызвала обсуждения среди пользователей Claude после того, как компания сообщила, что внедряет такую маркировку для соответствия EU AI Act’s Transparency Code.

Как это должно работать

Anthropic описывает механизм как выбор между близкими вариантами формулировок в ситуациях с низкими ставками. За счет таких выборов Claude может формировать в ответах паттерн, который не видит обычный читатель, но может обнаружить тот, у кого есть ключ для проверки.

Компания утверждает, что водяные знаки не влияют на качество вывода Claude, а для читателя помеченный ответ неотличим от непомеченного.

Чем водяной знак отличается от AI-детекторов

Anthropic отдельно отмечает, что водяные знаки не равны методам AI-детекции, которые ищут характерные признаки стиля в тексте. В качестве примера таких подходов в материале упоминается Pangram.

Компания заявила, что будет использовать SynthID-Text и планирует выпустить API для обнаружения водяных знаков.

Что будет с правками и кодом

Anthropic признает, что переписывание может скрыть водяной знак. При этом легкое редактирование, по ее словам, вероятно, не удалит метку полностью, а полная замена каждого слова может это сделать.

Если Claude только вычитывал или немного редактировал текст, обнаружение водяного знака будет зависеть от длины материала и масштаба правок. При легкой правке почти все слова остаются написанными человеком, поэтому водяному знаку почти не за что «зацепиться».

Для кода компания ожидает меньшую выраженность водяного знака, поскольку модель должна создавать рабочий код и не имеет такой же свободы выбора между равнозначными вариантами, как в обычном тексте.

Реакция пользователей

После объявления часть пользователей начала спорить о нововведении. В материале упоминаются обсуждения на Reddit, а также сообщение Business Insider о том, что десятки пользователей на X заявили об отмене подписки на Claude из-за водяных знаков.

Advertisement

Источники

Один основной источник. Как мы проверяем новости

  1. techcrunch.com