Искусственный интеллект

Перед релизом Astra исследователи спорят о прозрачности новой модели OpenAI

Вокруг готовящегося релиза Astra усилились опасения: The Information сообщает о более закрытой архитектуре модели, а специалисты по безопасности предупреждают, что ее может быть сложнее контролировать

Один основной источник · Как мы проверяем новости

Перед релизом Astra исследователи спорят о прозрачности новой модели OpenAI
Иллюстрация к материалу RedBTC News

Что произошло

Вокруг будущего релиза Astra разгорелась дискуссия о безопасности и прозрачности модели. После сообщения OpenAI о задержке релиза для работы над вопросами безопасности The Information написала, что Astra показывает заметно меньше своего «мышления», чем другие передовые AI-модели.

Это вызвало опасения у исследователей: если ход рассуждений модели хуже виден, ее действия может быть сложнее отслеживать до того, как она совершит нежелательные шаги.

Что известно об архитектуре

The Information со ссылкой на неназванного человека, знакомого с разработкой еще не выпущенной модели, утверждает, что Astra использует recurrent depth, или looped transformer. Такая техника прогоняет информацию через внутренние слои перед выдачей результата.

В таком случае большая часть «мышления» модели происходит внутри системы и в форме, менее похожей на естественный человеческий язык. Это может повышать производительность модели, но усложнять обнаружение потенциальных угроз и нежелательного поведения.

По данным того же неназванного источника The Information, OpenAI ограничила применение этой техники в Astra, чтобы исследователи могли продолжать следить за рассуждениями модели.

Почему это важно

Для современных AI-систем цепочка рассуждений может быть важным инструментом надзора: она позволяет исследователям и автоматизированным системам безопасности замечать ложь, попытки обойти защитные ограничения и другие нежелательные действия до их выполнения.

Главный научный сотрудник Redwood Research Ryan Greenblatt заявил, что решение использовать более непрозрачную архитектуру для Astra может стать одним из худших событий для AI-безопасности. Он также предупредил, что менее видимые рассуждения могут позволить AI-системам разрабатывать и выполнять стратегии, которые исследователям будет гораздо труднее обнаружить.

Как ответила OpenAI

В опубликованном во вторник блоге OpenAI заявила, что разворачивает Astra с дополнительным мониторингом chain-of-thought для быстрого выявления и сдерживания потенциально несогласованных действий. При этом компания не уточнила, имеет ли модель иную техническую основу.

Представители OpenAI ответили на критику в соцсетях, но, как пишет The Verge, прямо не отрицали использование спорной техники. Главный научный сотрудник Jakub Pachocki заявил, что глубина вычислений Astra находится в пределах двукратного отличия от GPT-4.

OpenAI не ответила на запрос The Verge с просьбой подтвердить или опровергнуть использование looped transformers в Astra и направила издание к публикации Pachocki в X.

Advertisement

Источники

Один основной источник. Как мы проверяем новости

  1. theverge.com