ИИ-компании скупают старые книги, чтобы учить нейросети

Разработчики ИИ заинтересовались бумажными книгами, изданными до 2022 года. 

Компания ISBNdb, которая занимается базой книжных данных, начала помогать ИИ-компаниям массово закупать печатные издания для обучающих датасетов. Особенно ценятся старые книги.

ISBNdb позиционирует их как источник профессионально написанных и отредактированных текстов, созданных до массового распространения LLM. Масштаб закупок может доходить до миллиона наименований за один заказ.

Спрос уже заметили продавцы: один из них рассказал 404 Media, что с апреля его продажи выросли примерно с 20 книг в неделю до нескольких сотен. Среди заказов встречаются редкие и давно не переиздававшиеся книги, а покупатели, по его словам, почти не торгуются о цене.

Для массовой оцифровки бумажных книг компании могут использовать «разрушительное» сканирование: корешок срезают, страницы пропускают через скоростные сканеры, а физический экземпляр утилизируют.

Именно так Anthropic оцифровала миллионы купленных книг, за что подверглась критике букинистов.

Применяют ли такую схему все нынешние клиенты ISBNdb, неизвестно. Компания предлагает заказчикам конфиденциальность и соглашения NDA.

Почему это важно

Рост объёма ИИ-контента меняет ценность исходных данных. Чем больше текстов создают нейросети, тем важнее для разработчиков становится возможность найти материалы с доказанным человеческим происхождением.

Источник: 404 Media