Anthropic привлекла Accenture к проверке безопасности своих моделей
Сотрудники Accenture начнут работать внутри Anthropic и оценивать модели, их защитные механизмы и соответствие заявленным принципам безопасности
Один основной источник · Как мы проверяем новости

Что произошло
Anthropic сообщила, что сотрудники технологической консалтинговой компании Accenture начнут работать внутри лаборатории, проверяя её модели и сотрудников.
Работы выполнит Faculty — компания, которую Accenture приобрела в январе и превратила в своё подразделение по искусственному интеллекту.
Чем займутся оценщики
Faculty будет оценивать модели, проводить проверки на устойчивость к атакам, анализировать их соответствие принципам безопасности и тестировать защитные механизмы.
Anthropic заявила, что в ближайшие недели объявит о других оценщиках. Компания также обсуждает с METR и другими некоммерческими организациями возможность протестировать отдельные элементы встроенной оценки за их собственное финансирование.
Почему это важно
Anthropic делает безопасность и соответствие моделей принципам выравнивания центральной частью своей миссии. При этом у внешних оценщиков пока нет общих стандартов доступа к лабораториям и взаимодействия с ними.
По словам Anthropic, Accenture выбрали благодаря практическому опыту внедрения искусственного интеллекта в крупных компаниях и государственных структурах. Как крупная публичная компания, существовавшая ещё до революции искусственного интеллекта, Accenture также считается функционально более независимой от Anthropic и связанной с ней экосистемы.
Контекст и критика
Обсуждение встроенных оценщиков ранее было сосредоточено главным образом на организациях, занимающихся исследованиями безопасности искусственного интеллекта, включая METR, Redwood Research и Apollo Research.
Интерес к независимым проверкам усилился после инцидентов, в которых агенты OpenAI и Anthropic взламывали внешние сайты, не вызвав тревоги внутри лабораторий.
Некоторые критики считают инициативу Dario Amodei формой саморегулирования отрасли, которая может позволить избежать ответственности за нарушения, допущенные моделями. Anthropic отвечает, что оценщики не снимают с компании ответственности, а делают её более проверяемой.
Источники
Один основной источник. Как мы проверяем новости


