Cloudflare выпустила под лицензией Apache 2.0 две открытые decision-модели — Clef (27B) и Clef-flash (9B), веса которых выложены на Hugging Face и уже доступны в облачной платформе Workers AI. В отличие от генеративных LLM такие модели не пишут текст: за один проход они возвращают вероятности каждого варианта по типизированным вопросам choice, bool и score, на основе которых агент выбирает следующее действие. Релиз примечателен тем, что в категории, где доминировал закрытый API, появился вариант, который можно и развернуть самостоятельно, и сразу использовать в облаке.

image
image
image

Что произошло

Cloudflare выложила на Hugging Face веса двух decision-моделей под лицензией Apache 2.0 и включила обе модели в платформу Workers AI. Старшая модель Clef дообучена на Qwen3.8-27B, младшая Clef-flash — на Qwen3.5-9B. Вместо порождения ответа словами каждая модель за один проход оценивает все опции из заданной схемы вопросов типов choice, bool и score и выдаёт вероятность каждого варианта, на которую агент опирается при выборе следующего шага. Обе модели принимают текст, JSON, изображения и видео и держат контекст 65 536 токенов. Дообучение велось с Brier-функцией потерь и методом RLCD, нацеленным на калибровку этих вероятностей. По данным Cloudflare, на медиане 43 тестов Clef отвечает за 209 мс против 524 мс у закрытой модели Jev, а Clef-flash — за 39 мс; в классификации BANKING77 Clef набирает 94,2 macro-F1 против 79,7 у Jev, а в ToolRet показывает 69,2 против 65,3 nDCG@10. Вместе с моделями Cloudflare объявила RL-платформу дообучения, которая ведёт сервис по цепочке из Worker, AI Gateway, Containers и Trainer, а затем повторно развёртывает обновлённую модель.

Контекст

Decision-модели закрывают давнюю проблему применения LLM там, где нужен не текст, а выбор. Генеративная модель формулирует ответ словами, и уверенность приходится извлекать из распределения по токенам, которое плохо согласуется с фактической частотой правильных решений, тогда как для агентного ветвления важна именно калибровка вероятности, а не привычная accuracy. Clef устроена иначе: по входному контексту выполняется один проход по базовой модели Qwen, после чего все опции из схемы оцениваются параллельно по логитам, и декодирующего цикла не происходит вовсе. Именно отказ от порождения текста объясняет заявленную задержку, несопоставимую со временем генеративного ответа. Обучение с Brier-функцией потерь и RLCD прицельно бьёт в соответствие заявленной вероятности реальной частоте правильных ответов. Рыночный фон такой: аналогичные возможности раньше поставлялись только закрытыми API, прежде всего моделью Jev от TypeSafe AI, и совместимость Clef с этим API задумана как ход для рынка — конкуренция приходит в категорию, где у разработчиков прежде выбора не было.

Почему это важно для индустрии

Для индустрии главное следствие — переносимость: полная совместимость с Jev/SystemOne API означает, что под существующей интеграцией достаточно переключить эндпоинт, не переписывая код, и смена поставщика decision-модели превращается в дешёвую операцию. В категории, работавшей на закрытом API, это меняет саму логику: ценность смещается от доступа к модели к её калибровке и дообучению под конкретный домен, и именно на это нацелена объявленная RL-платформа, сворачивающая обновление сервиса в один цикл. Заявленные задержки позволяют ставить классификацию, роутинг и выбор инструментов в горячий путь агента и продуктовой логики, а не только в фоновые пайплайны, то есть относиться к decision-модели как к обычному быстрому вызову внутри транзакции. Открытые веса дают командам к тому же инструмент независимой проверки вендорских цифр на собственных данных, что для категории, где раньше можно было только верить на слово, само по себе важно.

Почему это важно для пользователей

Практически модели доступны тремя путями. Веса Clef и Clef-flash можно бесплатно скачать с Hugging Face и развернуть на своём GPU — Cloudflare проверила локальный запуск на одной H200 со стеком torch 2.11 и transformers 5.10.2. Можно использовать облачные эндпоинты @cf/cloudflare/clef и @cf/cloudflare/clef-flash в Workers AI, где миллион входных токенов стоит $0,24 для Clef и $0,09 для Clef-flash, с гарантией, что Cloudflare не читает и не хранит запросы и не обучается на них. Рабочий сценарий простой: в JSON описывается схема типизированных вопросов choice, bool или score, на вход подаются текст, JSON, изображения или видео, а на выходе получаются вероятности каждой опции без разбора свободного текста. Разумный первый шаг для читателя — взять один классификационный шаг своего продукта, например триаж обращений или роутинг, прогнать через модель собственный набор вопросов и сравнить результат с тем, что сейчас делает существующая Jev-интеграция.

Что пока неизвестно / ограничения

Все ключевые цифры, включая задержку, BANKING77 и ToolRet, сообщены самой Cloudflare и пока не подтверждены независимыми замерами. В опубликованных источниках нет калибровочных метрик на отложенных данных вроде ECE или reliability diagram, поэтому обучение с Brier-функцией потерь и RLCD обещает калибровку, но не доказывает её, особенно вне распределения дообучения, и рано считать возвращаемые вероятности готовой основой для confidence-gating в интерфейсах. Заявленный в BANKING77 разрыв порядка четырнадцати пунктов macro-F1 нетипично велик для этой задачи и правдоподобнее объясняется дообучением под формат и близкие домены, чем универсальным превосходством модели, а разница по ToolRet невелика и может лежать в пределах разброса между пайплайнами. Кроме того, самостоятельный сервис дообучения на объявленной RL-платформе ещё не запущен: пока дообучение под домен выполняет только команда FDE Cloudflare, что сдерживает массовый доменный цикл.

Источники

Автор

Look at AI, редакция