Использование больших языковых моделей (LLM) для генерации оценок собственной уверенности (confidence scores) является научно невалидной практикой, которая создает лишь иллюзию надежности системы.



Что произошло
Автор Джастин Флик утверждает, что запрос у LLM прямой оценки уверенности является психологической уловкой, а не инструментом калибровки. Модели склонны группировать ответы вокруг круглых чисел и не способны отличить уверенность в фактической правильности от уверенности в лингвистической связности текста.
Контекст
Для получения реальной оценки надежности исследователи рекомендуют использовать методы семантической энтропии (semantic entropy) или обучение отдельных классификаторов на данных, полученных от LLM, вместо попыток получить числовой показатель из самого генеративного вывода.
Почему это важно для индустрии
Разработчикам ИИ-сервисов следует отказаться от добавления поля confidence в JSON-ответы моделей для логики принятия решений, так как это не повышает фактическую точность и может приводить к систематическим ошибкам в агентах. Вместо этого индустрии необходимо фокусироваться на качестве ретривала (RAG) и интеграции специализированных инструментов оценки (evals).
Почему это важно для пользователей
Пользователям не стоит доверять цифровым показателям уверенности в ответах нейросетей, если они не подкреплены технической калибровкой. Эти цифры отражают скорее готовность модели продолжать текст, а не вероятность того, что изложенные факты являются верными.
Источники
Автор
Look at AI, редакция
