📊 Два источника шума при оценке LLM

Статья описывает две основные причины шума при оценке работы больших языковых моделей (LLM): алеаторную неопределенность (неоднозначность входных данных) и эпистемическую неопределенность (непоследовательность «судьи»-модели). Автор предлагает использовать ансамбли моделей для оценки, переходить от оценок по шкале 1–5 к бинарным критериям и учитывать доверительные интервалы вместо фиксированных баллов.

🌍 Меняет подход к QA в AI-разработке — от восприятия тестов как бинарных юнит-тестов к статистическому прогнозированию и управлению доверительными интервалами. Это критично для построения надежных пайплайнов оценки (evals).

👤 Помогает понять, почему результаты бенчмарков часто «плавают», и как правильно выстраивать процесс тестирования своих агентов, используя ансамбли судей и объективные бинарные метрики.

Источник 1: https://wilburhimself.github.io/blog/64-the-two-sources-of-noise-every-llm-evaluation-system-must-handle/