Amazon уничтожает редкие книги ради обучения ИИ-моделей
Расследование показало, что Amazon скупает редкие, вышедшие из печати книги, срезает переплёты и сканирует текст для обучения своих языковых моделей. Такие книги ценны тем, что их содержание отсутствует в интернете и создано до появления ИИ-текстов.

Как выяснило издание 404 Media, компания Amazon скупает редкие книги, срезает с них переплёты и сканирует страницы, чтобы получить текст для обучения моделей искусственного интеллекта. Журналисты отследили путь одной такой книги, поместив в неё трекер, — устройство в итоге привело на склад Amazon в Лас-Вегасе под названием VGT3, который обозначается символом динозавра, держащего в лапах книгу.
В заявлении для 404 Media в Amazon подтвердили, что компания "приобретает книги через коммерческие каналы для улучшения продуктов и услуг, которыми пользуются клиенты", но не уточнили напрямую, используются ли они именно для обучения ИИ.
Почему ценятся именно редкие книги
Крупным технологическим компаниям, включая Amazon, требуются огромные объёмы текста для обучения языковых моделей, а ресурсы, доступные в интернете, уже во многом исчерпаны. Некоторые компании, в частности Anthropic, ранее сталкивались с обвинениями в использовании нелегально добытых, пиратских книжных текстов. Редкие и снятые с печати книги, содержание которых невозможно найти в сети, стали новым востребованным источником данных.
Особая ценность таких текстов в том, что любое издание, вышедшее до 2022 года, гарантированно не написано искусственным интеллектом. Это важно, поскольку обучение моделей на слишком большом количестве сгенерированного ИИ текста может привести к так называемому "коллапсу модели" — явлению, при котором качество результатов работы модели ухудшается после поглощения избыточного объёма машинно созданного контента.


