Содержание
ИИ-компании массово скупают подержанные книги через посредников, чтобы обучать модели на чистых человеческих текстах. 404 Media выяснило: заказы доходят до 1 млн книг за одну сделку, а часть изданий после сканирования просто режут и уничтожают.
История неприятная не из-за самого сканирования. Оцифровка книг давно живёт в библиотеках и архивах. Проблема в другом: книги уходят из оборота, попадают в закрытые датасеты и не возвращаются читателям.
Зачем ИИ понадобились бумажные книги
Большим языковым моделям нужны огромные массивы качественного текста, но интернет после 2022 года стал хуже для обучения. В сеть хлынул AI slop — дешёвый машинный контент, который загрязняет выборку и мешает учить новые модели на человеческой речи.
Поэтому компании снова смотрят на бумагу. Печатные книги чаще прошли редактуру, корректуру и издательский отбор. А старые издания ещё и не заражены текстами, которые сами нейросети уже успели нагенерировать.
Для модели это почти идеальная еда: длинные связные тексты, нормальная структура, разные жанры и темы. Для книжного рынка — странный новый покупатель, которому без разницы, роман это, учебник или справочник.
Посредники скупают книги без явного интереса к авторам
404 Media описывает схему с посредниками, которые закупают подержанные книги крупными партиями. В центре внимания оказалась ISBNdb — онлайн-база с более чем 111 млн каталогизированных книг, которой давно пользуются продавцы, библиотеки и дистрибьюторы.
По данным 404 Media, ISBNdb начала предлагать услуги по массовой закупке книг для ИИ-компаний. Размер заказов — от 1000 экземпляров до 1 млн книг за раз. Это уже не поведение обычного коллекционера или университетской библиотеки.
Один профессиональный продавец рассказал 404 Media, что всплеск начался в апреле. Раньше он продавал около 20 книг за хорошую неделю. В последние месяцы продажи выросли до нескольких сотен экземпляров в неделю. Сам продавец оценил рост минимум в пять раз.
Похожие всплески заметили продавцы на Alibris и Biblio. Покупатели брали только книги с ISBN — 13-значным международным кодом. При этом не просматривался интерес к теме, жанру или конкретному автору.
Ещё один красный флаг — цена. По данным продавцов, закупщики иногда брали переоценённые книги и не торговались. Для обычного рынка это странно. Для сборки датасета важнее закрыть список ISBN, чем сэкономить пару долларов на экземпляре.
Прямого доказательства, что именно ISBNdb или конкретная ИИ-компания стоит за каждой закупкой, пока нет. Но сама механика выглядит знакомо: крупный заказ, нейтральный посредник, минимум публичности и много одинаково ценных для алгоритма текстов.
Anthropic уже прошла через сканирование и суды
У этой истории есть прецедент. Anthropic, разработчик Claude, уже фигурировала в судебном деле о книгах для обучения ИИ. Компания покупала книги у Better World Books, тратила миллионы долларов на извлечение текста и после этого уничтожала бумажные экземпляры.
Суд признал, что использование книг для обучения ИИ может подпадать под fair use в американском авторском праве. Но отдельная проблема возникла из-за хранилища из 7 млн пиратских книг. За него Anthropic получила штраф $1,5 млрд (около 115 млрд рублей) за нарушение прав авторов и издателей.
Google тоже попала под давление издателей. Коалиция правообладателей подала иск против компании и обвинила её в незаконном использовании миллионов защищённых книг для разработки моделей Gemini.
Во время процесса против Anthropic Том Харви, который раньше участвовал в создании Google Books, подтвердил детали проекта цифровизации. В Anthropic он возглавлял Project Panama и привлекал компании для сканирования документов.
Среди подрядчиков фигурировала Datamation Information Services. Эта компания предлагает два подхода: бережное сканирование без разрушения книги и разрушительное сканирование. Во втором случае книгу разрезают, вынимают страницы и прогоняют их через скоростной промышленный сканер.
Для ИИ-компаний разрушительный путь дешевле и быстрее. Не нужно аккуратно раскрывать переплёт, бороться с изгибом страниц и ловить идеальный свет. Машина просто глотает листы один за другим.
Главный спор — не про технологию, а про доступ
Сама идея оцифровать книгу не вызывает вопросов, если после этого текст доступен библиотеке, исследователям или читателям. Здесь результат другой: физический экземпляр исчезает, а цифровая копия уходит в закрытую базу для обучения частной модели.
Риск особенно заметен для редких и давно не переиздававшихся книг. Пока нет прозрачных правил, которые отделяют массовые дешёвые тиражи от изданий, важных для архивов и будущих читателей. Покупка по ISBN без интереса к содержанию только усиливает этот вопрос.
Для индустрии ИИ это прагматичная гонка за качественным датасетом. Для книжного рынка — резкий спрос, который продавцы уже видят в заказах. Для читателя — неприятная сделка: модель становится умнее, но часть бумажной памяти уходит в шредер.
404 Media опубликовало расследование о закупках старых книг для ИИ; в судебных материалах Anthropic отдельно фигурировали 7 млн пиратских книг и штраф $1,5 млрд (около 115 млрд рублей).