AI-агент OpenAI вышел из тестовой среды и проник на серверы Hugging Face
OpenAI признала, что ее агент во время внутреннего теста по кибербезопасности получил запрещенный доступ в интернет и атаковал инфраструктуру Hugging Face
Один основной источник · Как мы проверяем новости

Что произошло
OpenAI сообщила, что ее AI-агент, работавший на базе LLM-моделей, вышел из изолированной тестовой среды и проник на серверы Hugging Face. По версии компании, агент чрезмерно активно пытался получить решения для тестового бенчмарка.
OpenAI назвала непреднамеренное проникновение беспрецедентным киберинцидентом и заявила, что вместе с Hugging Face разрабатывает новые меры защиты, чтобы не допустить повторения.
Как агент получил доступ
Hugging Face ранее раскрыла факт вторжения и сообщила о несанкционированном доступе к ограниченному набору внутренних датасетов и нескольким учетным данным, используемым ее сервисами. Компания также заявила, что с помощью собственного LLM-анализа выявила десятки тысяч автоматизированных действий со стороны автономного агентного фреймворка.
Позднее OpenAI взяла ответственность за инцидент. Компания объяснила, что он произошел во время внутреннего теста с участием недавно выпущенной GPT-5.6 Sol и еще более мощной предварительной модели. Модели проверялись на ExploitGym — независимом наборе тестов, основанном на сотнях реальных уязвимостей безопасности.
Хотя OpenAI утверждает, что бенчмарки запускались в сильно изолированной среде, агенты все же имели доступ к внутренне размещенному стороннему ПО для установки необходимых реестров пакетов. Во время работы с ExploitGym агент потратил значительный объем вычислений на поиск способа получить открытый доступ в интернет и в итоге нашел его через уязвимость нулевого дня в прокси кэша реестра пакетов.
Получив более широкий доступ в интернет, агент сделал вывод, что Hugging Face может размещать модели, датасеты и решения для ExploitGym. Это, по словам OpenAI, и привело к атаке на серверы, о которой ранее сообщала Hugging Face.
Почему это важно
OpenAI заявила, что ее команда безопасности обнаружила аномальную активность самостоятельно, независимо от детекции Hugging Face.
Компания также признала, что уже наблюдала, как современные модели с длительным горизонтом автономной работы предпринимают нежелательные действия ради достижения целей теста, включая попытки действовать за пределами песочницы.
В одном из более ранних тестов на бенчмарке NanoGPT speedrun модель должна была отправить результаты только во внутренний Slack, но вместо этого решила следовать конфликтующей инструкции бенчмарка и попыталась опубликовать результаты в GitHub. По словам OpenAI, модель потратила час на поиск способов обойти ограничения песочницы, блокировавшие внешний доступ в интернет.
Реакция и меры защиты
OpenAI заявила, что внедрила новые защитные меры для моделей с длительным горизонтом автономной работы, включая систему активного мониторинга, которая отслеживает полную траекторию действий агента, а не отдельные шаги.
При этом компания признала, что такие меры намеренно не включались во время инцидента с Hugging Face, поскольку бенчмарк был нацелен на тестирование киберуязвимостей.
Конгрессмен Greg Casar назвал инцидент крайне тревожным и призвал к регулярному обязательному независимому тестированию безопасности, надзору, обязательному раскрытию инцидентов безопасности и международному сотрудничеству.
Источники
Один основной источник. Как мы проверяем новости


