Искусственный интеллект

В материалах дела The New York Times раскрыли критику сбора данных для ИИ со стороны Microsoft и OpenAI

Нерассекреченные материалы иска The New York Times показывают, что руководители Microsoft и OpenAI считали массовый сбор контента угрозой для издателей, а данные Microsoft связывают работу Copilot со снижением переходов на сайт газеты максимум на 93%

Один основной источник · Как мы проверяем новости

В материалах дела The New York Times раскрыли критику сбора данных для ИИ со стороны Microsoft и OpenAI
Иллюстрация к материалу RedBTC News

Что произошло

Нерассекреченные сведения появились в рамках иска The New York Times, поданного против OpenAI и Microsoft из-за обучения генеративных моделей ИИ на материалах газеты. Новая публикация стала очередным обострением трехлетнего разбирательства.

Согласно материалам, компании получали контент в обход платного доступа, создавали обучающие наборы данных путем массового сбора и намеренно удаляли из них уведомления об авторских правах.

Что показали внутренние документы

Один из руководителей Microsoft в частном порядке описывал практики обучения моделей ИИ как «кражу». Руководство OpenAI, согласно материалам иска, называло собственные модели экзистенциальной угрозой для издателей и журналистов, чьи работы использовались для их обучения.

Данные Microsoft показывают, что функция Copilot в формате «движка ответов» могла снизить долю переходов на сайт The New York Times максимум на 93% по сравнению с традиционным поиском Bing.

Во внутренней презентации Microsoft за январь 2024 года это снижение описывалось как «замкнутый круг», который одновременно ухудшает работу моделей и всего интернета. Документ также указывал на угрозу экономической основе поставщиков контента для бизнеса больших языковых моделей.

Сатья Наделла во время дачи показаний заявил, что любой материал за платным доступом должен лицензироваться для использования при получении внешнего контекста или обучении. По его словам, если бы он знал об использовании OpenAI материалов за платным доступом, то воспользовался бы правом Microsoft потребовать переобучения моделей.

Почему это важно

Раскрытые признания могут противоречить защите OpenAI, основанной на доктрине добросовестного использования. Одно из требований этой доктрины заключается в том, чтобы использование произведения не заменяло оригинал и не наносило ущерба его рынку.

Правовой статус использования защищенных авторским правом материалов для обучения ИИ остается неопределенным. При этом суды в целом благосклонно относились к аргументам компаний в сфере ИИ о применимости добросовестного использования.

Контекст дела

Значительная часть новых сведений взята из собственного письменного документа The New York Times, а не из приложенных материалов дела: сами приложения остаются закрытыми. Кроме того, приведенные цитаты представлены без исходного контекста.

Ранее в этом месяце администрация Трампа представила письменную позицию в поддержку использования OpenAI защищенных авторским правом материалов без лицензии для обучения больших языковых моделей.

Advertisement

Источники

Один основной источник. Как мы проверяем новости

  1. techcrunch.com