Автор канала Tips AI протестировал опенсорс-плагин fast-jev-compaction, который передаёт компакцию чата в Claude Code вероятностной модели Jev от TypeSafe AI: вместо lossy-саммари от генерирующей LLM неактуальные tool-вызовы удаляются, а важное остаётся дословно. Установить плагин можно уже сегодня двумя командами, а версия jev-1.13.0 стоит $0,042 за миллион входных токенов. Доказательная база пока скромная: единичный тест автора и документация вендора, без измеренных метрик качества компакции.

image
image

Что произошло

Опыт опубликовал автор канала Tips AI: он получил доступ к модели Jev, протестировал плагин и разобрал, как тот меняет поведение Claude Code. Репозиторий tamaratran/fast-jev-compaction создан 17 сентября 2026 года, распространяется под лицензией MIT и за считаные дни набрал 1739 звёзд. Плагин опирается на функцию function hooks, доступную в Claude Code с версии 2.1.274, и берёт на себя компакцию чата: каждый tool_use и tool_result оценивается моделью Jev по двум типизированным noul-вопросам, «нужен ли сам вызов» и «нужен ли результат дословно». Вопросы уходят в модель параллельно и возвращают вероятности, по которым неактуальные вызовы удаляются или обрезаются, а всё сохранённое остаётся в контексте дословно, без пересказа.

Контекст

Компакция нужна агентным системам потому, что длинные сессии упираются в лимит контекстного окна, и до недавнего времени Claude Code решал проблему единственным способом: генерирующая LLM писала lossy-саммари переписки, а потеря деталей размазывалась по пересказу и оставалась невидимой для агента. Jev устроен иначе: это флагманская System One-модель TypeSafe AI, которая не генерирует текст, а принимает на вход состояние и параллельно отвечает на типизированные вопросы, возвращая вероятности, пригодные для прямого использования в коде. В текущей версии jev-1.13.0 один запрос вмещает 64k токенов, из которых 32k отводится на состояние плюс самый длинный вопрос. Из такой архитектуры следует и экономика: модель возвращает только структурированные ответы, а не сгенерированный текст, поэтому решение о важности контекста оплачивается исключительно по входным токенам.

Почему это важно для индустрии

Компакция контекста — узкое и дорогое место агентных систем, и в этом кейсе впервые вместо генерирующего LLM-саммари применена вероятностная модель-классификатор: определение важного превращается из задачи генерации в задачу классификации, которая на порядки дешевле и при параллельной оценке вопросов выполняется за десятки-сотни миллисекунд. Структурное отличие от саммари видно в поведении ошибок: в пересказе потеря информации размыта по всему тексту, а здесь ошибки классификатора концентрированы и бесшумны, ведь удалённое из контекста не восстановить, и агент не узнает, что нужное было выброшено. Если подход приживётся, «управление контекстом через удаление по вероятностям» станет отдельным паттерном для агентных фреймворков, а System One-модели — новым классом инфраструктуры рядом с генерирующими LLM; в ближайшие месяцы стоит ждать независимых сравнений с саммари, методик калибровки порогов и плагинов, предлагающих выбор стратегии компакции. В более длинной перспективе тот же механизм применим шире компакции: к приоритизации задач, фильтрации tool-результатов и маршрутизации вызовов.

Почему это важно для пользователей

Плагин ставится сегодня: нужно включить переменную CLAUDE_CODE_ENABLE_FUNCTION_HOOKS=1 в ~/.claude/settings.json и выполнить две команды, «claude plugin marketplace add tamaratran/fast-jev-compaction» и «claude plugin install fast-jev-compaction@fast-jev-compaction». После установки и ручная команда /compact, и авто-компакция идут через Jev, а при неудачном обращении к модели срабатывает фолбэк на встроенное саммари, поэтому риск сломать рабочий процесс невелик. Новым пользователям TypeSafe AI дают бесплатные $5, чего по подсчётам из поста хватает примерно на 125 млн входных токенов, то есть на десятки больших чатов. Главная практическая оговорка связана с лимитом состояния в 32k токенов: длинные сессии от 150k токенов придётся резать на куски, о чём автор теста отдельно предупреждал.

Что пока неизвестно / ограничения

Доказательная база пока слабая: единичный тест автора канала плюс документация вендора, и в источниках нет ни одной измеренной метрики качества компакции, будь то сохранение важного контекста или итоговая экономия. Цена и скорость — заявления вендора, а не результаты независимых замеров. Честно названные ограничения ограничивают применимость: Jev оценивает вызовы без их результатов, вероятность не гарантирует безопасность удаления, а токены считаются эвристикой, а не токенизатором, поэтому верхняя граница ошибки удаления заранее неизвестна. Из-за этого вывод «внедрять уже сегодня» как рабочее умолчание преждевременен: разумнее поэтапное подключение с проверкой на собственных задачах.

Источники

Автор

Look at AI, редакция