AI scraping снова всплыл в деле The New York Times против Microsoft и OpenAI. В раскрытых судебных документах нашли записку января 2023 года, где директор по прикладным наукам Microsoft Брент Хехт назвал сбор данных для ИИ "кражей труда беспрецедентного масштаба".

Формулировка там жестче, чем обычно звучит в публичных дискуссиях про нейросети. Хехт писал, что генеративный ИИ несет "реальный риск" для занятости тех людей, чьи тексты и работа попали в обучающие наборы без согласия. А сам scraping он описал как "крупнейшую кражу труда в истории человечества".

Записка Microsoft стала частью иска The New York Times

Эти фрагменты появились в судебных материалах по делу, которое The New York Times подала против Microsoft и OpenAI в 2023 году. Газета обвиняет компании в копировании и использовании защищенных авторским правом текстов без разрешения правообладателя.

Продолжение после рекламы

На документы после снятия части редактуры обратил внимание TechCrunch. Для индустрии это неприятный эпизод: не критик со стороны, а руководитель внутри Microsoft описывал проблему языком, который ближе к позиции издателей.

В иске фигурирует не только NYT. По версии истцов, промежуточные обучающие наборы OpenAI включали более 91 000 материалов от The New York Times, Daily News и Center for Investigative Reporting.

Истцы утверждают, что OpenAI удаляла уведомления об авторских правах перед попаданием материалов в большие датасеты. Логика, по их версии, простая: модель не должна была потом воспроизводить эти уведомления в ответах пользователям.

Copilot мог уводить до 93% переходов от NYT

Изображение к статье: Топ-менеджер Microsoft назвал AI scraping кражей труда

Внутренние исследования Microsoft, по данным судебных документов, показывали резкое падение трафика для издателя. Copilot мог снижать переходы на сайт The New York Times до 93% по сравнению с обычным поиском Bing.

Для медиа это не абстрактная юридическая тонкость. Если пользователь получает ответ прямо в чат-боте, он реже кликает на первоисточник. Издатель теряет просмотры, подписки и рекламные показы. А именно эти деньги оплачивают репортеров, редакторов, фотографов и расследования.

Хехт в записке описывал риск "doom loop" — петли, в которой LLM используют контент сайтов, затем отбирают у них трафик. После этого у редакций остается меньше ресурсов на новые тексты. Для нейросетей это тоже проблема: их будущие данные становятся беднее.

Сатья Наделла, глава Microsoft, тоже дал важное признание. Он говорил, что если бы знал о сборе OpenAI данных за paywall, Microsoft могла бы потребовать переобучить модели без этих защищенных материалов.

Спор уперся в fair use и будущее датасетов

Главный юридический вопрос остается прежним: можно ли обучать коммерческие LLM на защищенных текстах без лицензии. Разработчики ИИ часто опираются на доктрину fair use, а издатели считают это массовым использованием их продукта без сделки.

Правительство США подало в суд statement of interest и поддержало более широкую трактовку fair use для разработки LLM. В документе сказано, что ограничение разработки языковых моделей из-за неверного понимания fair use помешало бы "творческому и научному прогрессу".

Продолжение после рекламы

Для пользователей вся история выглядит как спор больших компаний. Но итог ударит и по обычному интернету. Если чат-боты забирают ответы у сайтов, сайты должны понять, кто платит за исходную работу. Без этого цепочка "автор — редакция — читатель — поисковик" начинает трещать.

Дело The New York Times против Microsoft и OpenAI остается открытым. В судебных документах уже фигурируют записка Брента Хехта от января 2023 года, оценка падения переходов на 93% и наборы данных с более чем 91 000 спорных публикаций.

Рейтинг: 0 / 5. Оценок: 0

Рекомендуем почитать

Оставьте комментарий

Перед оставлением комментария, пожалуйста, ознакомьтесь с правилами комментирования.