ИИ-компании скупают старые книги, чтобы учить нейросети
Разработчики ИИ заинтересовались бумажными книгами, изданными до 2022 года.
Компания ISBNdb, которая занимается базой книжных данных, начала помогать ИИ-компаниям массово закупать печатные издания для обучающих датасетов. Особенно ценятся старые книги.
ISBNdb позиционирует их как источник профессионально написанных и отредактированных текстов, созданных до массового распространения LLM. Масштаб закупок может доходить до миллиона наименований за один заказ.
Спрос уже заметили продавцы: один из них рассказал 404 Media, что с апреля его продажи выросли примерно с 20 книг в неделю до нескольких сотен. Среди заказов встречаются редкие и давно не переиздававшиеся книги, а покупатели, по его словам, почти не торгуются о цене.
Для массовой оцифровки бумажных книг компании могут использовать «разрушительное» сканирование: корешок срезают, страницы пропускают через скоростные сканеры, а физический экземпляр утилизируют.
Именно так Anthropic оцифровала миллионы купленных книг, за что подверглась критике букинистов.
Применяют ли такую схему все нынешние клиенты ISBNdb, неизвестно. Компания предлагает заказчикам конфиденциальность и соглашения NDA.
Почему это важно
Рост объёма ИИ-контента меняет ценность исходных данных. Чем больше текстов создают нейросети, тем важнее для разработчиков становится возможность найти материалы с доказанным человеческим происхождением.
Источник: 404 Media