Содержание
ИИ-компании всё активнее скупают печатные книги, выпущенные до 2022 года. Причина простая: эти тексты почти наверняка писали люди, а не чат-боты.
По данным 404 Media, брокер данных ISBNdb поставляет физические книги AI-лабораториям крупными партиями. Речь идёт о поставках до миллиона экземпляров, причём имена клиентов компания закрывает соглашениями о неразглашении.
Проблема не в самой оцифровке. Быстрая промышленная схема часто требует срезать корешок книги, разобрать блок на отдельные страницы и прогнать их через автоматический сканер. После этого оригинальный том уже не вернуть на полку.
Почему AI-лаборатории охотятся за книгами до 2022 года
Книги, изданные до массового взлёта генеративных моделей, стали ценным сырьём для обучения LLM. Они дают более чистый корпус: редактура, плотный текст, проверенная структура и меньше риска наткнуться на машинную кашу из интернета.
Для разработчиков это не академическая прихоть. Если модель слишком долго учится на текстах, которые породили другие модели, качество начинает проседать. Этот эффект называют model collapse: система всё хуже держит фактуру, стиль и разнообразие языка.
Печатные книги решают ещё одну задачу. ISBNdb утверждает, что старые издания не содержат современных приёмов защиты от обучения. Некоторые авторы уже меняют цифровые документы так, чтобы сбивать парсеры и портить датасеты.
С точки зрения инженера всё логично. Нужен большой объём человеческого текста, желательно чистого и структурного. С точки зрения библиотекаря начинается неприятный разговор: не каждый бумажный экземпляр можно считать расходником.
Сканеры ускоряют работу, но уничтожают оригиналы
Высокоскоростное сканирование дешевле аккуратной оцифровки без повреждения переплёта. Работник срезает корешок, разделяет страницы и подаёт их в машину, которая быстро снимает изображения для будущего датасета.
Такой подход годится для массового учебника с тысячами копий. Но продавцы книг, с которыми говорила 404 Media, заявили о попадании в эти программы редких томов. Некоторые экземпляры пережили войны, пожары и столетия хранения.
И вот здесь цена ошибки становится другой. Современную книгу можно снова напечатать или найти в другом магазине. У редкого исторического издания может остаться несколько физических копий, а иногда счёт идёт на единицы.
ISBNdb, судя по описанию своей услуги, понимает репутационный риск. На сайте компании приводят формулировку в духе: «AI company destroys two million books» — плохой заголовок для публичной симпатии. Клиентам предлагают называть процесс цифровым сохранением.
Юридический спор уже дошёл до суда США
Свежий судебный эпизод с Anthropic добавил теме веса. Суд США признал сканирование легально купленных книг для обучения ИИ добросовестным использованием при конкретных условиях дела.
Один из аргументов звучал так: если бумажный экземпляр уничтожают при сканировании, цифровая копия фактически заменяет одну легальную книгу. То есть компания не размножает один купленный том в десятки копий для внутреннего обращения.
Но это не закрывает вопрос редких изданий. Юридическая логика про «одна копия вместо одной копии» плохо отвечает на вопрос сохранности. Если последний доступный том разрезали ради датасета, цифровой файл уже не заменит переплёт, бумагу, пометки и историю экземпляра.
Для AI-компаний тут неприятный выбор. Медленное бережное сканирование дороже и хуже масштабируется. Разрезание книг быстрее, но создаёт риск культурной потери, которую нельзя откатить патчем или новым релизом модели.
На критику метода в X от пользователя @Hedgie отреагировал Илон Маск. Он написал: «Я попросил команду SpaceXAI сохранить редкие книги в библиотеке и сканировать их сложным способом».