Технологические компании активно скупают печатные издания, превращая их в «топливо» для обучения нейросетей. Как сообщает издание 404 Media, после процесса оцифровки физические книги зачастую уничтожаются. Закупки проводятся через сеть посредников, что позволяет разработчикам ИИ скрывать свое участие в сделках. Согласно данным расследования, объем партий варьируется от одной тысячи до миллиона экземпляров, причем интересы покупателей охватывают практически всю доступную литературу, независимо от авторов или жанров.
Крупным игроком на этом рынке стала база данных ISBNdb. Ранее сервис обслуживал библиотечные сети и книжные магазины, однако теперь он сменил вектор, предлагая услуги по централизованному сбору книг специально для нужд разработчиков искусственного интеллекта.
Продавцы на площадках подержанной литературы, таких как Alibris и Biblio, подтверждают аномальный всплеск спроса: если ранее обороты исчислялись парой десятков книг в неделю, то теперь показатели измеряются сотнями.

Механизм использования печатных изданий для тренировки нейросетей уже фигурировал в материалах судебных разбирательств, в частности, в деле компании Anthropic. Подрядчики Anthropic сканировали приобретенные книги, предварительно разрезая их на отдельные страницы для обеспечения максимально высокой скорости промышленного сканирования — этот разрушающий метод обходится значительно дешевле, чем бережная оцифровка.
Несмотря на то что суд признал использование легально купленных книг для обучения моделей соответствующим принципу добросовестного использования (fair use), разработчики все равно сталкиваются с претензиями. Например, Anthropic стала фигурантом иска из-за формирования внутренней библиотеки из семи миллионов «пиратских» книг. Аналогичные обвинения предъявили издатели к компании Google, утверждая, что для обучения модели Gemini использовались миллионы произведений, защищенных авторским правом.
Эксперты подчеркивают, что печатные книги превратились в дефицитный ресурс, так как их содержимое создано людьми и не содержит «шума», характерного для контента, сгенерированного самим ИИ. В то же время возникает этическая дилемма: в ходе массовой оцифровки могут безвозвратно исчезать редкие или давно не переиздававшиеся книги, которые уничтожаются после сканирования, а их цифровые копии оседают в закрытых проприетарных датасетах.





