🤖 LLM не могут объективно оценить свою уверенность

Джастин Флик утверждает, что использование LLM для генерации собственных confidence scores является научно невалидным. Вместо реальной калибровки такие показатели создают лишь иллюзию надежности.

🌍 Разработчики ИИ-сервисов должны осознать, что добавление поля confidence в JSON-ответ модели не повышает ее фактическую точность.

👤 Не стоит доверять цифрам «уверенности» в ответах нейросетей, если они не подкреплены глубокой технической калибровкой.

Источник 1: https://justinflick.com/2026/07/27/llm-confidence-scores.html