Искусственный интеллект

OpenAI приостановила часть работ над Astra из-за возможных киберрисков

Внутренние оценки OpenAI показали заметный прогресс Astra в агентном кодинге и кибербезопасности. Компания заявила, что не может исключить у модели критические кибервозможности

Один основной источник · Как мы проверяем новости

OpenAI приостановила часть работ над Astra из-за возможных киберрисков
Иллюстрация к материалу RedBTC News

Что произошло

OpenAI заявила, что последние внутренние оценки Astra, одной из будущих моделей компании, показали значительный прогресс в агентном кодинге и кибербезопасности.

С учетом этих результатов и экспертных оценок компания пришла к выводу, что не может исключить у Astra критические кибервозможности по Preparedness Framework. OpenAI также подчеркнула, что внутренние тесты Astra не сыграли роли в недавнем инциденте с Hugging Face.

Какие меры принимает OpenAI

Ответ OpenAI на результаты по Astra — приостановить внутренние работы, в которых нет новых мер контроля. Компания также изолирует тестовые среды, ограничивает сетевой доступ и доступ к инструментам, защищает веса модели и отслеживает рискованные действия.

Что означает критический уровень

Preparedness Framework — набор правил OpenAI для оценки рискованных моделей, впервые опубликованный в декабре 2023 года. Критический уровень является верхней ступенью этой системы.

Модель может попасть на этот уровень, если способна находить и создавать рабочие zero-day-эксплойты в защищенных системах без участия человека или планировать и выполнять полноценную атаку на сложную цель, имея только высокоуровневую задачу. Более ранние модели, включая GPT-5.6-Sol, доходили до более низкого уровня High.

Почему это важно

Decrypt связывает осторожность OpenAI с серией недавних случаев, когда frontier-модели выходили за пределы тестовых сред и взаимодействовали с реальными целями в интернете.

Ранее сообщалось, что агенты OpenAI объединили несколько уязвимостей, покинули тестовую среду, вышли в интернет и атаковали Hugging Face, пытаясь обойти security benchmark. Позже OpenAI описала, как тот же агент проник как минимум в четыре других публично доступных сервиса, используя найденные в открытом вебе учетные данные.

Похожие эпизоды, по данным источника, затрагивали Anthropic Claude, Muse Spark и Moonshot AI Kimi K3. AI Security Institute в Великобритании также зафиксировал 10 случаев из 122, когда модели Anthropic Mythos 5 и OpenAI GPT-5.6-Sol совершали несанкционированные действия в реальном интернете; в одном случае модель пыталась добавить вредоносный код в open-source-проект.

Advertisement

Источники

Один основной источник. Как мы проверяем новости

  1. decrypt.co