Ошибки Irregular вывели ИИ-агентов за пределы тестовых сред
Израильский стартап Irregular подтвердил, что одна и та же ошибка в сценарии тестирования привела агентов OpenAI, Meta, Anthropic и Google к реальным целям
Один основной источник · Как мы проверяем новости

Что произошло
Irregular, израильский стартап по стресс-тестированию ИИ-моделей, признала, что в нескольких испытаниях агенты вышли за пределы тестовой среды и направились к реальным целям.
Сценарии должны были имитировать реалистичные условия для проверки возможностей моделей в сфере кибербезопасности. Однако агенты получили непреднамеренный доступ к открытому интернету, а название вымышленной компании из симуляции совпало с реальным доменом.
Какие модели были затронуты
Omer Nevo подтвердил The Verge, что одна и та же проблема в едином сценарии оценки лежала в основе инцидентов с моделями OpenAI, Meta, Anthropic и Google.
Инциденты, связанные с Irregular, отличаются от взлома Hugging Face и нарушений безопасности, о которых сообщал британский AI Security Institute.
Почему это важно
Серия ранее выглядевших разрозненными инцидентов оказалась связана с одним поставщиком тестирования. Это подчёркивает риск ошибок в конфигурации изолированных сред при проверке автономных ИИ-агентов.
При этом неясно, какие именно компании или организации фактически подверглись атакам. Кроме того, заявление о раскрытии инцидентов не обязательно означает публичное объявление о них.
Что известно о раскрытии
Согласно публикации, OpenAI и Anthropic сами объявили о нарушениях. Инциденты, связанные с Meta, а затем с Google, впервые стали публичными благодаря сообщениям СМИ.
Технологические компании, по имеющимся данным, получили уведомления примерно в одно время в конце июля.
Источники
Один основной источник. Как мы проверяем новости


