Выпущена версия v0.3.0 Prism-Eval — первого публичного open-source фреймворка для unit-тестирования недетерминированных AI-агентов. Инструмент от Amin Parva (Insight IT Solutions) позволяет запускать adversarial-тесты против агентов, работающих с извлечением данных, документооборотом и tool calling, и интегрируется в существующие CI/CD-конвейеры через pytest, JUnit и SARIF.
Что произошло
Опубликован Prism-Eval v0.3.0 под лицензией Apache 2.0, доступный через pip install prism-eval. Фреймворк обнаруживает четыре класса недетерминированных ошибок LLM-агентов: digit drop — упущение цифр при извлечении сумм из документов, prompt injection — внедрение вредоносных промптов, layout shifts — сдвиги макета документов, нарушающие извлечение, и OCR noise — шумы оптического распознавания. Фреймворк работает с любыми агентами — LangGraph, CrewAI, HTTP-эндпоинты — без привязки к конкретному orchestration-стеку. Companion-пакет Prism-Shield добавляет runtime-защиту агентов в продакшене.
Контекст
Стандартные тестовые фреймворки, такие как pytest, предполагают детерминированные выходные данные кода и не способны проверить стохастическое поведение LLM-агентов. Тестирование агентных систем находилось в режиме демо: команды запускали агенты на примерах и надеялись на отсутствие критических сбоев. Prism-Eval вводит формализованную G4-классификацию adversarial-случаев — первое систематическое разделение типов уязвимостей, специфичных именно для агентных систем, а не для генеративных моделей в целом. Ключевой принцип фреймворка — инвариант zero critical false accepts, который требует, чтобы агент ни при каких adversarial-условиях не пропустил критическую ошибку.
Почему это важно для индустрии
Для отрасли Prism-Eval закрывает разрыв между демо-режимом и инженерным процессом. Интеграция с pytest и экспорт в JUnit/SARIF делает инструмент совместимым с существующими DevOps-пайплайнами без переписывания инфраструктуры. Формализация G4-случаев создаёт основу для будущих бенчмарков агентных систем, аналогичных HELM или BigBench для генеративных моделей. Инвариант zero critical false accepts может стать стандартной метрикой в pitch-презентациях и технических заданиях для агентных продуктов. Для стартапов инструмент снижает стоимость QA агентных систем и ускоряет выход в продакшен.
Почему это важно для пользователей
Разработчики могут установить Prism-Eval командой pip install prism-eval и запустить встроенный adversarial-корпус против собственного агента за 30 секунд. Это даёт немедленную обратную связь по уязвимостям до релиза, особенно критичную для финансовых операций, где digit drop — упущение цифр в суммах — может привести к прямым финансовым потерям. Продукт-команды получат отчёт SARIF как доказательство надёжности агента для заказчика. Существующие инженерные навыки и процессы покрывают новую задачу тестирования — не требуется обучение новым инструментам.
Что пока неизвестно / ограничения
Нет эмпирических данных об эффективности G4-корпусов — неизвестно, какую долю реальных сбоев агентов они действительно обнаруживают. Отсутствует сравнительный анализ с другими решениями для тестирования AI-агентов. Методологическая строгость классификации G4-случаев не подтверждена независимым исследованием. Prism-Shield как companion-пакет runtime-защиты не имеет публичных метрик эффективности.
Источники
Автор
Look at AI, редакция
