В деле The New York Times против OpenAI и Microsoft рассекречены внутренние документы на 92 страницы, показывающие, что обе компании заранее осознавали последствия своей ИИ-стратегии для веба. Директор Microsoft по прикладным наукам Брент Хехт называл сбор обучающих данных «потрясающей кражей невиданных масштабов», а внутренний документ Microsoft признавал, что ИИ-стратегия запустила «doom loop», подрывающий экономику моделей и всего веба. Исход иска определит, считается ли обучение моделей на чужих текстах нарушением авторских прав, и от этого зависит, как читатели будут получать доступ к новостям.

Что произошло
В рамках процесса, возбуждённого The New York Times, в публичный доступ попали 92 страницы внутренних материалов OpenAI и Microsoft и показаний руководителей обеих компаний. Сатья Наделла под присягой подтвердил, что чат-боты «замещают» переходы на исходные сайты, а глава ChatGPT Ник Тёрли называл ИИ-продукты «экзистенциальной угрозой» для издателей, у которых «нет веской причины кликать» по ссылкам. Внутренняя запись OpenAI от июня 2022 года фиксирует ожидание, что GPT-4 «запомнит тонну данных и будет безумно хороша в регургитации»; при этом представители компании не знали о попытках найти или удалить пейволленный контент из датасетов. Среди рассекреченных материалов фигурируют и случаи дословного воспроизведения статей The New York Times, Mercury News и The Denver Post.
Контекст
Центральный вопрос процесса — применимость доктрины fair use к обучению языковых моделей на охраняемых текстах. Ключевым прецедентом здесь считается решение Andy Warhol Foundation v. Goldsmith 2023 года, где замещение оригинала производным произведением стало главным аргументом против fair use, поэтому показания о замещении трафика имеют прямой юридический вес. Фон дела — явление «Google Zero»: коллапс реферального трафика издателей, когда ответы чат-ботов и ИИ-поиска заменяют переходы по ссылкам. Показательно, что это первый случай, когда сами компании письменно зафиксировали, что LLM «уничтожают свою цепочку поставок контента»: без кликов издатели теряют доход и производят меньше нового текста для обучения следующих моделей. При этом перед нами судебные документы в изложении The Verge, а не научная работа: это документированные высказывания конкретных людей и компаний, а не peer-reviewed доказательства.
Почему это важно для индустрии
Замкнутый контур, описанный в документах, означает для отрасли смещение конкурентного преимущества к продуктам на лицензированных данных и явной атрибуции: парадигма «бесплатного скрейпинга» признана самоуничтожающей самими её участниками. Компаниям придётся демонстрировать очистку датасетов от пейволленного контента и аудируемые процессы provenance — отсутствие таких процессов у OpenAI стало юридическим, а не только техническим дефектом. Переговоры о лицензировании контента и ценах на данные усложняются в пользу правообладателей: впервые аргументом служат письменные признания самих компаний, а не оценки критиков. Если ваш продукт файнтюнится на скрейпленных данных или генерирует пересказы новостных сайтов, разумно провести аудит датасетов на пейволл-контент и замерить долю дословного воспроизведения в выдаче. По мере движения дела ожидается расширение лицензионных сделок с издателями и рост спроса на методы подавления меморизации: дедупликацию, unlearning и retrieval вместо запоминания. Если fair use для обучения будет ограничен, лицензированные корпуса станут обязательной частью обучения, открытый веб как источник данных сожмётся, а доля синтетических данных вырастет со всеми рисками деградации качества; веб при этом может разделиться на слой, открытый для агентов, и слой закрытого лицензионного доступа.
Почему это важно для пользователей
Для читателей документы — редкая возможность увидеть, что топ-менеджеры OpenAI и Microsoft знали о побочных эффектах своих продуктов заранее, причём из первоисточника, а не из пересказа критиков. Практический смысл прям: когда чат-бот пересказывает новость вместо перехода на первоисточник, издатель теряет клик и доход, за счёт которого существует журналистика. В перспективе это грозит читателю более плотными пейволлами, лицензионными стенами и разделением веба на открытую и закрытую для агентов части. Следить стоит и за тем, как используемые ИИ-продукты атрибутируют источники: от этого зависит, останется ли у читателя путь к оригиналу. Полный файл filings и разбор The Verge доступны публично, так что выводы можно проверить самостоятельно.
Что пока неизвестно / ограничения
Запись от июня 2022 года о меморизации не доказывает измеренную способность модели: в документах нет методологии — ни уровней меморизации, ни статистики дедупликации, ни eval-протокола, а задокументированное намерение не равно измеренному результату. Материал представляет собой подборку цитат из судебных документов в изложении The Verge: это документированные высказывания конкретных людей, но не peer-reviewed доказательства и не бенчмарки. Неизвестно, как суд в итоге решит вопрос о fair use, какие материалы будут рассекречены дальше и как выглядят реальные пайплайны очистки данных у компаний.
Источники
- OpenAI and Microsoft knew they were starting a 'doom loop' for the web — The Verge
- Hacker News discussion: OpenAI and Microsoft knew they were starting a 'doom loop' for the web
Автор
Look at AI, редакция
