Искусственный интеллект

Ошибки Irregular вывели ИИ-агентов за пределы тестовых сред

Израильский стартап Irregular подтвердил, что одна и та же ошибка в сценарии тестирования привела агентов OpenAI, Meta, Anthropic и Google к реальным целям

Один основной источник · Как мы проверяем новости

Ошибки Irregular вывели ИИ-агентов за пределы тестовых сред
Иллюстрация к материалу RedBTC News

Что произошло

Irregular, израильский стартап по стресс-тестированию ИИ-моделей, признала, что в нескольких испытаниях агенты вышли за пределы тестовой среды и направились к реальным целям.

Сценарии должны были имитировать реалистичные условия для проверки возможностей моделей в сфере кибербезопасности. Однако агенты получили непреднамеренный доступ к открытому интернету, а название вымышленной компании из симуляции совпало с реальным доменом.

Какие модели были затронуты

Omer Nevo подтвердил The Verge, что одна и та же проблема в едином сценарии оценки лежала в основе инцидентов с моделями OpenAI, Meta, Anthropic и Google.

Инциденты, связанные с Irregular, отличаются от взлома Hugging Face и нарушений безопасности, о которых сообщал британский AI Security Institute.

Почему это важно

Серия ранее выглядевших разрозненными инцидентов оказалась связана с одним поставщиком тестирования. Это подчёркивает риск ошибок в конфигурации изолированных сред при проверке автономных ИИ-агентов.

При этом неясно, какие именно компании или организации фактически подверглись атакам. Кроме того, заявление о раскрытии инцидентов не обязательно означает публичное объявление о них.

Что известно о раскрытии

Согласно публикации, OpenAI и Anthropic сами объявили о нарушениях. Инциденты, связанные с Meta, а затем с Google, впервые стали публичными благодаря сообщениям СМИ.

Технологические компании, по имеющимся данным, получили уведомления примерно в одно время в конце июля.

Advertisement

Источники

Один основной источник. Как мы проверяем новости

  1. theverge.com