Содержание
Иск NYT против OpenAI и Microsoft получил неприятный для компаний поворот. Юристы газеты раскрыли внутренние цитаты про обучение ИИ на чужих текстах.
В одном мемо директор Microsoft назвал AI scraping «крупнейшей кражей труда в истории человечества». А руководитель ChatGPT в OpenAI назвал чат-бота «экзистенциальной угрозой» для издателей.
Речь идет о процессе, который The New York Times начала в конце 2023 года. Газета обвиняет OpenAI и Microsoft в нарушении авторских прав на тысячи новостных материалов. Сейчас команда NYT просит суд вынести решение в упрощенном порядке.
Внутренние мемо бьют по защите fair use
Юридический бриф NYT опирается на заявления и документы самих ответчиков. Часть этих документов остается закрытой или отредактированной по просьбе OpenAI и Microsoft, пишет 404 Media.
Самая жесткая цитата пришла из внутреннего мемо Microsoft за январь 2023 года. Его автором NYT называет Брента Хехта, директора Applied Science в Microsoft.
По версии NYT, Хехт писал, что миллионы людей скоро сочтут «засасывание» их работы большими моделями «поразительной кражей беспрецедентного масштаба». Там же он назвал это «крупнейшей кражей труда в истории человечества».
Еще один документ Microsoft формулирует проблему проще. «Почти никто не рассчитывал, что созданный им контент используют таким образом. И почти никто не получает за это компенсацию», — говорится в цитате из брифа NYT.
Copilot мог резко снизить переходы на сайт NYT
NYT использует в суде не только моральный аргумент про труд авторов. Газета показывает экономический ущерб: по внутренним данным Microsoft, Copilot снижал кликабельность материалов The New York Times до 93% относительно обычного поиска Bing.
Для издателя это ключевой момент. Поисковик обычно дает короткий фрагмент и ведет читателя на сайт. Чат-бот чаще отвечает внутри интерфейса. Пользователь получает суть и не открывает первоисточник.
Хехт в другом мемо назвал такую схему «doom loop», то есть петлей гибели. По его словам, конечный продукт угрожает экономической базе своих главных поставщиков. Он писал, что такая ситуация сложилась у LLM-бизнеса с его «цепочкой поставок контента».
У OpenAI цитаты звучат не мягче. Руководитель ChatGPT Ник Терли писал во внутренних коммуникациях, что чат-боты — «экзистенциальная угроза» издателям. Он объяснял это тем, что они «в значительной степени заменяют» сайты и будут заменять их сильнее по мере улучшения.
Один инженер OpenAI дал показание в том же духе: «как бы заметно мы ни показывали ссылки, пользователи не будут кликать». А исследователь Ник Райдер писал президенту OpenAI Грегу Брокману о «хаке для обхода paywall NYT». Брокман ответил: «ah nice».
Спор упирается в fair use и деньги издателей
OpenAI и другие AI-компании строят защиту вокруг доктрины fair use. Она допускает ограниченное использование защищенных материалов для критики, комментариев, новостей, обучения, исследований и научной работы.
В американском законе суды смотрят на четыре фактора. Они описаны в разделе 107 закона об авторском праве США:
- Цель использования: коммерческая или некоммерческая образовательная.
- Характер произведения: какой именно контент использовали.
- Объем копирования: сколько взяли от исходного произведения.
- Влияние на рынок: портит ли использование стоимость оригинала.
У AI-компаний уже есть удачные прецеденты. Один суд согласился, что использование опубликованных материалов компанией Anthropic подпадает под fair use. Но спор NYT с OpenAI и Microsoft выглядит жестче из-за внутренних цитат.
Если руководители знали о вреде для издателей, четвертый фактор fair use становится болезненным. Суд будет смотреть не только на технологию обучения моделей. Он оценит, заменяет ли ChatGPT рынок, на котором NYT зарабатывает подписками и рекламой.
Гендиректор Microsoft Сатья Наделла на допросе в этом году сказал, что «все, что закрыто paywall, должно лицензироваться теми, кто хочет использовать это для grounding или обучения». Он добавил: если бы узнал, что OpenAI собирала и обучалась на данных за paywall, Microsoft потребовала бы «переобучить модели».