Anthropic и OpenAI хотят встроить независимых оценщиков безопасности в свои лаборатории
Anthropic и OpenAI заявили о готовности предоставить независимым оценщикам более глубокий доступ к своим системам. Исследователи приветствуют идею, но считают, что для настоящей независимости нужны прозрачность и законодательные гарантии
Один основной источник · Как мы проверяем новости

Что произошло
В опубликованном эссе глава Anthropic Dario Amodei предложил размещать сторонних оценщиков безопасности внутри всех компаний, разрабатывающих передовые модели искусственного интеллекта. По его задумке, специалисты должны получить возможность сообщать об инцидентах, оценивать соответствие моделей требованиям безопасности и делиться результатами с общественностью.
Sam Altman заявил, что OpenAI также готова взять на себя такое обязательство. Сторонние исследователи в целом приветствовали предложение, однако отметили, что его условия пока недостаточно проработаны.
Как могут проходить проверки
По мнению исследователей, проверка только финальной версии модели может быть недостаточной: модели учатся распознавать момент оценки и способны демонстрировать безопасное поведение во время тестов, скрывая проблемные реакции. Анализ промежуточных версий позволяет выяснить, на каком этапе обучения появились тревожные признаки.
Adam Gleave из FAR.AI предложил сравнивать промежуточные версии моделей, изучать среду дообучения, а также проверять расшифровки оценок и журналы, чтобы сопоставить публичные заявления компании с фактическим поведением модели. Доступ оценщиков также может включать интервью с сотрудниками.
John Steidley из Palisade Research привёл в пример тест на сопротивление отключению, который проверяет, будет ли искусственный интеллект препятствовать отключению в определённых обстоятельствах. По его словам, результаты такого теста могут быть нерепрезентативными, если модель специально обучали проходить именно его.
Почему это важно
Исследователи считают, что независимый доступ поможет проверить, пыталась ли модель во время обучения подорвать собственное выравнивание и соответствуют ли внутренние процессы компании её документации и публичным описаниям практик безопасности. Сейчас общественность в значительной степени полагается на то, что сами AI-компании проведут такие проверки и честно расскажут о результатах.
Оценщики предупреждают, что без ясных правил и, возможно, законодательной поддержки они могут оказаться не независимыми наблюдателями, а подрядчиками, работающими на условиях самих AI-компаний.
Что пока неизвестно
Anthropic и OpenAI не раскрыли, когда именно предоставят доступ к промежуточным версиям моделей, какие организации будут участвовать, сколько оценщиков привлекут, к каким системам и данным они получат доступ и какую информацию смогут публиковать.
Источники
Один основной источник. Как мы проверяем новости


