ИИ-компании массово скупают подержанные книги через посредников, чтобы обучать модели на чистых человеческих текстах. 404 Media выяснило: заказы доходят до 1 млн книг за одну сделку, а часть изданий после сканирования просто режут и уничтожают.

История неприятная не из-за самого сканирования. Оцифровка книг давно живёт в библиотеках и архивах. Проблема в другом: книги уходят из оборота, попадают в закрытые датасеты и не возвращаются читателям.

Зачем ИИ понадобились бумажные книги

Большим языковым моделям нужны огромные массивы качественного текста, но интернет после 2022 года стал хуже для обучения. В сеть хлынул AI slop — дешёвый машинный контент, который загрязняет выборку и мешает учить новые модели на человеческой речи.

Продолжение после рекламы

Поэтому компании снова смотрят на бумагу. Печатные книги чаще прошли редактуру, корректуру и издательский отбор. А старые издания ещё и не заражены текстами, которые сами нейросети уже успели нагенерировать.

Для модели это почти идеальная еда: длинные связные тексты, нормальная структура, разные жанры и темы. Для книжного рынка — странный новый покупатель, которому без разницы, роман это, учебник или справочник.

Посредники скупают книги без явного интереса к авторам

404 Media описывает схему с посредниками, которые закупают подержанные книги крупными партиями. В центре внимания оказалась ISBNdb — онлайн-база с более чем 111 млн каталогизированных книг, которой давно пользуются продавцы, библиотеки и дистрибьюторы.

По данным 404 Media, ISBNdb начала предлагать услуги по массовой закупке книг для ИИ-компаний. Размер заказов — от 1000 экземпляров до 1 млн книг за раз. Это уже не поведение обычного коллекционера или университетской библиотеки.

Один профессиональный продавец рассказал 404 Media, что всплеск начался в апреле. Раньше он продавал около 20 книг за хорошую неделю. В последние месяцы продажи выросли до нескольких сотен экземпляров в неделю. Сам продавец оценил рост минимум в пять раз.

Похожие всплески заметили продавцы на Alibris и Biblio. Покупатели брали только книги с ISBN — 13-значным международным кодом. При этом не просматривался интерес к теме, жанру или конкретному автору.

Ещё один красный флаг — цена. По данным продавцов, закупщики иногда брали переоценённые книги и не торговались. Для обычного рынка это странно. Для сборки датасета важнее закрыть список ISBN, чем сэкономить пару долларов на экземпляре.

Изображение к статье: ИИ-компании скупают и уничтожают книги для обучения моделей

Прямого доказательства, что именно ISBNdb или конкретная ИИ-компания стоит за каждой закупкой, пока нет. Но сама механика выглядит знакомо: крупный заказ, нейтральный посредник, минимум публичности и много одинаково ценных для алгоритма текстов.

Anthropic уже прошла через сканирование и суды

У этой истории есть прецедент. Anthropic, разработчик Claude, уже фигурировала в судебном деле о книгах для обучения ИИ. Компания покупала книги у Better World Books, тратила миллионы долларов на извлечение текста и после этого уничтожала бумажные экземпляры.

Продолжение после рекламы

Суд признал, что использование книг для обучения ИИ может подпадать под fair use в американском авторском праве. Но отдельная проблема возникла из-за хранилища из 7 млн пиратских книг. За него Anthropic получила штраф $1,5 млрд (около 115 млрд рублей) за нарушение прав авторов и издателей.

Google тоже попала под давление издателей. Коалиция правообладателей подала иск против компании и обвинила её в незаконном использовании миллионов защищённых книг для разработки моделей Gemini.

Во время процесса против Anthropic Том Харви, который раньше участвовал в создании Google Books, подтвердил детали проекта цифровизации. В Anthropic он возглавлял Project Panama и привлекал компании для сканирования документов.

Среди подрядчиков фигурировала Datamation Information Services. Эта компания предлагает два подхода: бережное сканирование без разрушения книги и разрушительное сканирование. Во втором случае книгу разрезают, вынимают страницы и прогоняют их через скоростной промышленный сканер.

Для ИИ-компаний разрушительный путь дешевле и быстрее. Не нужно аккуратно раскрывать переплёт, бороться с изгибом страниц и ловить идеальный свет. Машина просто глотает листы один за другим.

Главный спор — не про технологию, а про доступ

Сама идея оцифровать книгу не вызывает вопросов, если после этого текст доступен библиотеке, исследователям или читателям. Здесь результат другой: физический экземпляр исчезает, а цифровая копия уходит в закрытую базу для обучения частной модели.

Риск особенно заметен для редких и давно не переиздававшихся книг. Пока нет прозрачных правил, которые отделяют массовые дешёвые тиражи от изданий, важных для архивов и будущих читателей. Покупка по ISBN без интереса к содержанию только усиливает этот вопрос.

Для индустрии ИИ это прагматичная гонка за качественным датасетом. Для книжного рынка — резкий спрос, который продавцы уже видят в заказах. Для читателя — неприятная сделка: модель становится умнее, но часть бумажной памяти уходит в шредер.

404 Media опубликовало расследование о закупках старых книг для ИИ; в судебных материалах Anthropic отдельно фигурировали 7 млн пиратских книг и штраф $1,5 млрд (около 115 млрд рублей).

Рейтинг: 0 / 5. Оценок: 0

Рекомендуем почитать

Оставьте комментарий

Перед оставлением комментария, пожалуйста, ознакомьтесь с правилами комментирования.