Искусственный интеллект

Anthropic заявила о масштабных атаках на Claude со стороны Alibaba, Moonshot AI и DeepSeek

Anthropic сообщила о пяти кампаниях по извлечению возможностей Claude, связанных с китайскими AI-компаниями. Всего компания зафиксировала почти 200 млн обменов

Один основной источник · Как мы проверяем новости

Anthropic заявила о масштабных атаках на Claude со стороны Alibaba, Moonshot AI и DeepSeek
Иллюстрация к материалу RedBTC News

Что произошло

Anthropic опубликовала новый отчет о продолжающихся атаках по дистилляции со стороны базирующихся в Китае AI-компаний. Компания утверждает, что за последние месяцы методы обхода ее защиты стали более сложными.

По оценке Anthropic, злоумышленники пытались извлечь внутренние рассуждения Claude и использовать их для обучения меньших моделей. В отчете говорится, что атаки затрагивали агентные возможности и работу с инструментами, программирование, анализ данных и логическое рассуждение.

Детали кампаний

Всего Anthropic зафиксировала почти 200 млн обменов, связанных с пятью отдельными кампаниями. Компания назвала их более масштабными и агрессивными по сравнению с ранее выявленной активностью.

Крупнейшую кампанию Anthropic приписывает Alibaba. С мая по июль 2026 года она включала 151 млн обменов и достигала почти 3 млн обменов в день. Запросы поступали с 3 500 аккаунтов, но использовали единый фиксированный промпт для извлечения цепочки рассуждений. Anthropic считает, что данные собирались для подготовки материалов для семейства моделей Qwen.

Другую кампанию компания связала с Moonshot AI, разработчиком Kimi. По версии Anthropic, запросы могли поступать непосредственно от китайских военных структур. Среди них был запрос на анализ записей с камер видеонаблюдения, чтобы определить, ведет ли себя человек ненормально. За десять дней через 5 000 аккаунтов к Claude направили почти 300 000 запросов, главным образом к модели Opus.

Почему это важно

Дистилляция предполагает извлечение рассуждений модели из ответов на запросы и последующее использование этих данных для дообучения другой, меньшей модели.

Anthropic обычно не показывает пользователям внутреннюю цепочку рассуждений моделей, ограничиваясь блоками с обобщенным описанием процесса мышления. Однако, как утверждает компания, участники кампаний нашли способы заставить модель напрямую раскрывать следы рассуждений. В одном случае запрос замаскировали под просьбу о переводе.

Контекст

Anthropic уже сообщала об атаках по дистилляции в феврале и называла отдельные лаборатории. OpenAI также рассказывала о похожей активности, связав ее непосредственно с DeepSeek.

Advertisement

Источники

Один основной источник. Как мы проверяем новости

  1. techcrunch.com