Компания Openlayer выпустила в open source Python-библиотеку jevals, которая заменяет дорогой вызов фронтьерной модели-судьи типизированными вопросами к модели решений Jev — той же, что доступна через TypeSafe API и Vercel AI Gateway. Проверка одного трейса агента стоит доли цента и занимает сотни миллисекунд, а в бенчмарке авторов оценка качества агента обходится примерно на два порядка дешевле, чем через генеративного судью Ragas. Проекту неделя, он находится в статусе alpha, и по независимому бенчмарку JevBench точность Jev пока на уровне самых маленьких LLM, поэтому пороги придётся калибровать под свои данные.

image
image

Что произошло

Openlayer выложила на GitHub Python-библиотеку jevals и анонсировала её на Hacker News в формате Show HN. Библиотека работает поверх модели решений Jev: вместо генерации текста модель одним forward-пассом возвращает калиброванные вероятности для каждого типизированного вопроса — yes/no, выбор варианта или оценку по рубрике. Девять проверок агента, включая ToolChoice, Grounded, StayedInScope, AnswerRelevancy, Completeness, IndirectInjection и PHI, выполняются одним HTTP-запросом примерно за 0,5 секунды и 0,00006 доллара на трейс. В комплекте 37 готовых eval-метрик, YAML-описание проверок, трёхуровневые гейты allow/escalate/block перед вызовами инструментов в продакшене и адаптеры для OpenAI Agents SDK и LangGraph.

Контекст

Чтобы оценить качество ответов ИИ-агента, команды обычно используют LLM-судью: дорогостоящую фронтьерную модель, которая читает трейс и генерирует текстовый вердикт. Такой подход дорог, медлителен и недетерминирован: по замерам LangChain разброс оценок судей на базе GPT и Claude в 92–913 раз выше, чем у Jev, а фреймворк Ragas на четыре метрики делает от 6 до 11 LLM-вызовов на каждый сэмпл. Из-за этих цен eval-метрики оставались офлайн-этапом на CI, а не частью работающего сервиса. Интерес к альтернативам заметен и на уровне платформ: LangChain публиковал отдельный материал о том, может ли Jev быть агентным эвалюатором, то есть класс типизированных моделей решений обсуждается и внутри крупных LLMOps-экосистем.

Почему это важно для индустрии

Для индустрии это сигнал о сдвиге цен в LLMOps: по бенчмарку авторов на модели gpt-4.1-mini проверка тысячи сэмплов через jevals стоит 0,03 доллара против 2,60 доллара у Ragas, а латентность падает с 22–35 секунд до 0,8 секунды на 20 сэмплов. При такой цене evals и guardrails превращаются из дорогой надстройки на CI в дешёвую per-call инфраструктуру внутри агентного цикла. Трёхуровневые гейты allow/escalate/block позволяют собрать гибридную архитектуру, где дешёвый типизированный судья проверяет каждый вызов инструмента, а дорогая фронтьерная модель подключается только на эскалациях. jevals напрямую конкурирует с Ragas, DeepEval и платными LLM-судьями, и если независимые замеры подтвердят цифры, давление на ценообразование этих инструментов и LangSmith усилится.

Почему это важно для пользователей

Тем, кто собирает собственного ИИ-агента, библиотека доступна одной командой pip install jevals. С её помощью можно проверять каждый шаг агента: выбор инструмента, опору на источники, удержание в рамках задачи, полноту ответа, утечки персональных данных и непрямые инъекции в результатах инструментов. Политика качества описывается в YAML, для юнит-тестов есть backend="mock", а для данных, которые нельзя отправлять в облако, — локальные модели Kev или Laya на Mac. Разумная стартовая схема — обернуть вызовы инструментов гейтами и первое время работать в режиме теневого логирования с эскалацией, калибруя пороги на своих данных командой jevals calibrate.

Что пока неизвестно / ограничения

Все эффектные цифры бенчмарков — стоимость на трейс, сравнение с Ragas и латентность — заявлены самим вендором, методология отбора задач и метрик не раскрыта, а замер против Ragas на gpt-4.1-mini измеряет цену и скорость на узком наборе сценариев. По независимому бенчмарку JevBench точность Jev составляет 83–87 процентов на Banking77 и CLINC150, то есть на уровне самых маленьких LLM, а это до примерно 15 процентов ошибок классификации на границе порогов; авторы сами советуют не доверять классификатору авторизацию необратимых действий. Проекту неделя, он находится в статусе alpha с тремя звёздами на GitHub и пока пригоден скорее для экспериментов, некритичных проверок и гейтов с эскалацией, а вопрос, воспроизведутся ли заявленные цифры в независимых замерах и выдержит ли библиотека продакшен, остаётся открытым.

Источники

Автор

Look at AI, редакция