Британская финтех-компания Saturn (Saturn Fintech, Лондон) в сентябрьском отчёте «Artificial Authority: Should you trust AI to deliver financial advice?» протестировала 18 популярных ИИ-моделей, включая ChatGPT, Claude, Copilot, Grok и Gemini, на 121 реальном финансовом вопросе — и обнаружила, что неверно отвечено больше чем в половине случаев, а на сложных темах ошибки становятся почти неизбежными. Материал об исследовании опубликовал Financial Times. При этом аудитория настроена доверчивее, чем позволяет точность моделей: по опросу PensionBee, большинство взрослых пользователей США готово действовать на совет чат-бота, не проверяя его.

image
image

Что произошло

Saturn Fintech, финансовая компания из Лондона, в сентябре 2026 года опубликовала отчёт «Artificial Authority: Should you trust AI to deliver financial advice?». В тесте участвовали 18 популярных ИИ-моделей, в том числе ChatGPT, Claude, Copilot, Grok и Gemini. Моделям задали 121 реальный финансовый вопрос о пенсиях, налогах, долгах, студенческих кредитах и сбережениях; каждый вопрос повторяли пять раз, всего было проанализировано более 10 000 ответов. В среднем модели ошибались в 57% случаев. На сложных вопросах средняя доля ошибок росла до 88%, а отдельные модели ошибались в 99% случаев. Основные режимы сбоя — незнание актуальных налоговых правил и выдуманные «финансовые правила», которых не существует. Материал об отчёте опубликовал Financial Times.

Контекст

Такой профиль сбоев ожидаем для универсальных моделей без привязки к данным: знания LLM зафиксированы на момент обучения и ограничены knowledge cutoff, а налоговые ставки и правила по кредитам меняются постоянно, поэтому без grounding на официальные источники модель воспроизводит устаревшие или синтезированные факты. Выдуманные «финансовые правила» — типичная галлюцинация в высокорисковой домене, где retrieval помогает лишь частично, если модель достраивает правила поверх или вместо найденного текста. Схема «каждый вопрос пять раз» дополнительно измеряет не только корректность, но и стабильность ответов: расхождения на одном и том же вопросе указывают на проблемы калибровки. При этом методология отчёта в открытых материалах не раскрыта, а подготовлен он вендором-финтехом, а не независимыми исследователями, поэтому цифры пока нельзя считать воспроизведённым результатом. Ожидания аудитории от «ИИ-советчика» сформировались раньше, чем появились проверки его точности: граница между «информацией» и «советом», о размывании которой предупреждал британский регулятор FCA в обзоре Mills Review, в пользовательском восприятии практически исчезла.

Почему это важно для индустрии

Отчёт фиксирует разрыв регулирования: лицензированный финансовый советник за такой уровень ошибок потерял бы лицензию, а языковая модель получает очередное обновление версии. Позиционирование «чат-бот как финансовый советник» на сырой модели после этого выглядит дефектным продуктовым паттерном, а любой оффер «ИИ даёт финансовые советы» теперь встречает возражение конкретными цифрами. Одновременно открывается рыночное окно для слоя доверия: grounding на актуальные нормативные данные, цитирование официальных источников в интерфейсе, пометки о дате актуальности, guardrails и режим dry-run для агентских действий. Практический чек-лист для ML-команд: не выпускать сырую модель на финальные денежные решения, собрать доменный eval на собственных вопросах — методика повторных прогонов легко воспроизводится, — закрыть время-чувствительные факты retrieval по официальным источникам и логировать ответы для наблюдаемости. Ставки повышает внедрение agentic payments, которое Worldline, ING и Mastercard запустили в июне 2026 года: участникам рынка приходится вводить ограничения на LLM до появления жёстких правил регулирования. В ближайшие месяцы доменные бенчмарки, вероятно, станут фильтром закупок: банки и вендоры будут требовать измеримой точности на своих вопросах, а не маркетинговых обещаний.

Почему это важно для пользователей

Опрос PensionBee среди 1000 взрослых пользователей США показывает масштаб разрыва между доверием и надёжностью: 57% готовы действовать на совет чат-бота без проверки, а 23% уже получали от него неверные финансовые данные. Практический вывод — не доверять чат-боту финальные денежные решения: размер переплаты по ипотеке, стратегию выхода на пенсию, параметры займа. На сложных темах вроде налогов и студенческих кредитов ошибается почти всё поле моделей, и они часто не знают текущие налоговые ставки. Общие принципы личных финансов чат-боты объясняют приемлемо, поэтому их можно использовать как отправную точку, но конкретные цифры необходимо проверять по официальным источникам — именно этот шаг, по данным опроса, сейчас пропускает большинство.

Что пока неизвестно / ограничения

Методология отчёта в открытых материалах не раскрыта: нет определения ошибки (фактическая неточность или уклончивый ответ), нет описания судей — люди или LLM-as-judge, нет эталонных ответов и детальной разбивки по моделям. Поэтому цифры 57%, 88% и 99% корректно считать vendor claim до независимого воспроизведения. Схема «121 вопрос, каждый по 5 раз» измеряет самосогласованность ответов только при зафиксированных определении ошибки, судье и эталонах; без этого устойчивость и корректность не разделить. Отчёт подготовлен финтех-компанией с собственным продуктовым интересом, а не рецензируемой исследовательской группой. Неизвестно также, какие именно версии моделей и с какими настройками участвовали в тесте.

Источники

Автор

Look at AI, редакция