Рассекреченные по решению суда материалы иска New York Times против Microsoft и OpenAI показали, что обе компании ещё до публичного запуска ChatGPT и Copilot фиксировали замещающий эффект своих продуктов и осознавали вред издателям. Директор прикладной науки Microsoft Брент Хехт называл скрейпинг новостей для обучения ИИ «astonishing theft of unprecedented proportions», глава ChatGPT Ник Турли признавал чат-боты для издателей «existential threat», а телеметрия самой Microsoft фиксировала падение кликабельности ссылок на сайты издателей в Copilot на 83–93% по сравнению с обычным поиском Bing. От исхода дела зависит, обязаны ли все ИИ-компании лицензировать новостной контент.

image
image

Что произошло

По решению суда в деле New York Times против Microsoft и OpenAI раскрыты ранее засекреченные внутренние документы обеих компаний. В меморандуме, датированном январём 2023 года, директор прикладной науки Microsoft Брент Хехт называл скрейпинг новостей для обучения ИИ «astonishing theft of unprecedented proportions» и, возможно, «крупнейшей кражей труда в истории человечества». Глава ChatGPT Ник Турли в тот же период признавал, что чат-боты представляют для издателей «existential threat», поскольку продукты «в значительной степени замещают» новости. По собственным данным Microsoft, кликабельность ссылок на сайты истцов в Copilot падала на 83–93% по сравнению с обычным поиском Bing. В датасетах OpenAI истцы нашли свыше 91 692 копий произведений NYT, Daily News и Center for Investigative Reporting и более 2 млн документов с nytimes.com, а президент OpenAI Грег Брокман ответил «Ah, nice» на сообщение инженера Ника Райдера о «хаке» обхода пейволла. Истцы просят суд вынести решение по summary judgment только по статьям с обширным дословным совпадением, где падение кликабельности достигало максимальных значений.

Контекст

Иск New York Times был подан в декабре 2023 года и стал центральным тестом того, подпадает ли обучение и использование генеративного ИИ под защиту fair use. Ключевой параметр этого спора — замещение: защита fair use предполагает, что использование не должно замещать оригинал, поэтому измеримый отток читателей от издателей к ИИ-продуктам бьёт по самому основанию защиты. Хронология в деле имеет значение: внутренние оценки вреда датированы январём 2023 года и относятся к периоду до публичного запуска ChatGPT и Copilot, что, по логике истцов, указывает на осознанность действий. Замещение истцы доказывали промптами вида «what's the next line?» и «rate the bias», которые методологически эквивалентны известным академическим тестам на дословное запоминание и извлечение, но впервые работают как судебная улика, а не исследовательский протокол. Редкость раскрытых материалов и в том, что они дают внешний взгляд внутрь закрытых обучающих корпусов OpenAI, которые компания ранее не раскрывала.

Почему это важно для индустрии

Для ИИ-индустрии раскрытые документы превращают замещение исходного контента из абстрактного юридического риска в измеримую величину: телеметрия самой Microsoft показывает, что answer-based интерфейс отбирает у источника подавляющую часть переходов. Это прямой сигнал, что паттерн «суммаризуй новости без атрибуции» нежизнеспособен, а преимущество смещается к citation-first продуктам, лицензированным фидам и инфраструктуре provenance данных. Юридически материалы подрывают защиту fair use: внутренние оценки обеих компаний фиксируют и замещение, и осознание вреда ещё до запуска продуктов, поэтому любые датасеты со скрейпом новостей теперь несут документированное осознание вреда. Истцы сделали ставку на «удар двух кулаков» — замещение плюс дословные выдержки — и просят summary judgment только по статьям с обширным дословным совпадением; если суд примет телеметрию замещения и промпт-пробы как доказательства, внутренние eval'ы продуктов рискуют превратиться в стандартную судебную улику. Компаниям, чьи продукты зависят от суммаризации новостей, уже сейчас разумно провести аудит происхождения обучающих и retrieval-данных, добавить в cost model сценарий лицензионных платежей и начать замерять CTR исходящих ссылок и долю ответов, замещающих источник. При победе издателей лицензирование новостного контента может стать отраслевой нормой для всех ИИ-компаний — именно такой сценарий записан в самих документах как выход из «дилеммы заключённого», при которой каждой компании выгодно пользоваться бесплатным контентом, пока другие платят.

Почему это важно для пользователей

Если суд встанет на сторону издателей, ответы ChatGPT и Copilot по новостным темам могут стать менее полными, с обязательными ссылками на источники и лицензионными платежами — либо сервисам придётся заключать платные сделки с медиа. Ничего в продуктах не ломается немедленно: это раскрытые судебные документы, а не решение суда, поэтому сегодняшние ответы выглядят как прежде. Показательно и признание Сатьи Наделлы о пейволлах: даже главные бенефициары ИИ считают лицензирование paywalled-контента обязательным, то есть часть ответов уже сейчас может опираться на лицензированные, а не свободно собранные данные. Пользователям стоит привыкать к более явной атрибуции: в сценарии победы издателей ссылка на первоисточник перестанет быть декоративной и станет обязательным элементом новостного ответа.

Что пока неизвестно / ограничения

В раскрытых материалах нет методологии замера падения кликабельности на 83–93%: не раскрыто, какие запросы и за какой период анализировались, как считался знаменатель сравнения с Bing и насколько эффект был равномерным, поэтому трактовать эту цифру как готовую индустриальную метрику замещения или продуктовый ориентир преждевременно. Не раскрыто и то, что именно считалось «копией» среди 91 692 найденных произведений и как выполнялась дедупликация при подсчёте документов с nytimes.com. Наконец, это раскрытые судебные документы, а не установленные судом факты: ни замещение, ни обязанность лицензировать контент пока юридически не признаны, и исход запрошенного summary judgment неизвестен.

Источники

Автор

Look at AI, редакция