Разработчики искусственного интеллекта начали массово закупать печатные книги, изданные до 2022 года, чтобы обеспечить чистоту обучающих данных и защитить модели от деградации.
Что произошло
Компании, занимающиеся разработкой ИИ, переходят к масштабной закупке физических печатных изданий, выпущенных до 2022 года. Для ускорения процесса оцифровки применяется метод деструктивного сканирования, при котором корешки книг разрезаются для максимально быстрого прогона страниц через сканеры.
Контекст
Основной причиной такого подхода является необходимость избежать «загрязнения» обучающих выборок синтетическим контентом, известным как AI slop. Использование данных, созданных современными языковыми моделями, может привести к эффекту model collapse — прогрессирующей деградации качества и разнообразия ответов ИИ.
Почему это важно для индустрии
Этот процесс формирует новый рынок высококачественных физических данных и меняет подходы к защите авторских прав, смещая фокус в сторону доктрины fair use. В долгосрочной перспективе это может создать технологический разрыв между моделями, обученными на «чистых» исторических данных, и теми, кто использует преимущественно синтетический веб-контент.
Почему это важно для пользователей
Для читателей это означает риск безвозвратной потери редких физических изданий из-за их массовой утилизации в процессе оцифровки. С другой стороны, это гарантирует, что будущие поколения ИИ будут обладать более высоким качеством знаний и меньшим количеством галлюцинаций, вызванных ошибками в интернет-текстах.
Что пока неизвестно / ограничения
Существуют разногласия в оценке последствий: технические специалисты видят в этом развитие новых пайплайнов данных, в то время как правовые и культурные эксперты указывают на угрозу утраты физического культурного наследия.
Источники
Автор
Look at AI, редакция
