NPR совместно с NewsGuard протестировали, как шесть популярных ИИ-чатботов с доступом в интернет, от ChatGPT до Claude, и ИИ-сводки поисковиков реагируют на пятнадцать ложных нарративов пропаганды Китая, Ирана и России. Чатботы в среднем опровергали фейки примерно в 75% случаев и справлялись с проверкой лучше традиционного поиска, а ИИ-сводки над поисковой выдачей разоблачали ложь заметно реже. Это одно из первых систематических сравнений шести ведущих чатботов и четырёх поисковиков на актуальной пропагандистской повестке, и его главный сигнал в том, что RAG-чатботы с веб-доступом пока устойчивее, чем ИИ-резюме в поиске.

image

Что произошло

В тесте участвовали ChatGPT от OpenAI, Gemini от Google, Copilot от Microsoft, Meta AI, Grok от xAI и Claude от Anthropic, все с доступом в интернет. Наблюдения шли с декабря 2025 года по июль 2026 года: ассистентов проверяли на пятнадцати ложных нарративах, которые продвигали пропаганда Китая, Ирана и России, и сравнивали с обычным поиском и ИИ-сводками поверх выдачи. По ИИ-сводкам картина разошлась: Bing в большинстве случаев ложь не разоблачал, Google AI Overview в основном разоблачал, DuckDuckGo занял промежуточное место. Показателен кейс июня 2026 года с фейком об ударе Украины по Киево-Печерской лавре: здесь все чатботы и Google AI Overview правильно указали, что вопрос построен на ложной посылке. Отдельное наблюдение: Claude чаще сбоил, когда опирался на провластные источники, а чатботы цитировали государственные СМИ примерно так же часто, как обычный поиск выдавал такие ссылки.

Контекст

Ключ к результатам — архитектурная разница между двумя типами продуктов. Чатбот с веб-доступом работает как RAG-система: он итеративно извлекает источники, сопоставляет их и синтезирует ответ, при необходимости возвращаясь к поиску, тогда как ИИ-сводка над выдачей — это однократное резюме поверх уже отранжированных ссылок. Слабым звеном в такой сводке оказывается не сама языковая модель, а слой извлечения и краткого пересуммирования. Поведение ассистентов в кейсе с лаврой как раз показало, что проверка пресуппозиции перед ответом — воспроизводимое свойство grounding-стека, а не случайная удача. Наблюдение за Claude зеркально подтверждает роль источников: одна и та же модель деградировала, когда в контексте преобладали провластные материалы, то есть качество корпуса в retrieval-слое влияет на итог сильнее, чем способности базовой модели. И ещё один важный нюанс: опровержение фейка в тексте ответа не равно гигиене источников, потому что фильтрация происходит только на этапе генерации, а пропаганда продолжает сидеть в retrieval-слое.

Почему это важно для индустрии

Для вендоров это публичное давление, прежде всего на Microsoft: под такими результатами ей почти неизбежно придётся улучшать верификацию фактов в ИИ-сводках Bing, а различие «чатбот с grounding против ИИ-сводки над выдачей», похоже, становится отдельной осью оценки продуктов. Для команд, разрабатывающих RAG-системы, тест — фактически открытый adversarial-бенчмарк с дешёвым протоколом: взять актуальные нарративы, прогнать свой пайплайн и измерить две метрики, долю опровержений фейков и долю цитат из сомнительных источников. Из этого следуют вполне конкретные задачи: внедрить скоринг доверенности источников в retrieval-пайплайн, собрать eval-набор из живых пропагандистских нарративов для регресса, реализовать второй проход с пересуммированием по источникам и настроить мониторинг доли цитат из государственных и низкодостоверных медиа. Минимально рабочий прототип из двух проходов — первый ответ чатбота, затем аудит источников и пересуммирование с показом разницы версий — собирается за дни. В горизонте ближайших месяцев ожидаемы повторения методики академическими группами, а second-pass verification может закрепиться как стандартный шаблон в библиотеках агентов; в более долгой перспективе взвешивание источников по доверию способно стать штатным слоем grounding-стека, при этом пропаганда будет адаптироваться через SEO под LLM и отравление корпуса источниками, выглядящими авторитетными.

Почему это важно для пользователей

При проверке сомнительной новости разумная отправная точка — чатбот с веб-поиском, а вот ИИ-сводки над выдачей Bing стоит перепроверять по другим материалам или обычным поиском. В настройках важно учитывать разницу: у DuckDuckGo ИИ-резюме отключить можно, у Google AI Overview такой возможности пока нет. Работает и простой приём от Майка Колфилда, эксперта University of Washington: попросить бота посмотреть на источники и пересуммировать — второй ответ почти всегда лучше первого. Полезно и заглядывать в список ссылок под ответом: даже когда модель разоблачает фейк, в цитатах могут оказаться государственные и провластные медиа, и это само по себе повод для настороженности.

Что пока неизвестно / ограничения

Оценка «примерно 75%» — это на практике около 11–12 разоблачённых нарративов из пятнадцати, поэтому перевёрнутый хотя бы один кейс сдвигает итог на 6–7 процентных пунктов. Такая выборка не тянет ни на устойчивый порог зрелости класса чатботов, ни на крупные выводы вроде коммодитизации. Это к тому же снимок по конкретной повестке декабря 2025 года — июля 2026 года: как результаты поведут себя на новых нарративах и при адаптации пропаганды, покажут дальнейшие проверки, для которых, по ожиданиям наблюдателей, методику повторят с большей выборкой и раскрытой статистикой.

Источники

Автор

Look at AI, редакция