Cloudflare выпустила в публичную бета-версию Auto Router для AI Gateway: вместо ручного выбора модели разработчику достаточно указать в коде идентификатор «cloudflare/auto», и роутер на границе сети сам подберёт модель под задачу, балансируя ожидаемое качество и цену. Во внутреннем бенчмарке Cloudflare такой роутинг показал точность, близкую к флагманским моделям, при заметно меньших затратах в расчёте на успешную задачу. Пока продолжается бета, роутинг бесплатен.


Что произошло
Auto Router работает на границе сети поверх Workers AI и GPU: многофункциональный классификатор размечает входящий запрос по 14 категориям задач и выставляет оценки от 1 до 5 по четырём осям — сложности, неоднозначности, цене ошибки и зависимости от контекста. Далее скоринговая матрица выбирает исполнителя по формуле «ожидаемое качество минус адаптивный штраф за цену», а пул кандидатов фильтруется по учётным данным, лимитам расходов и здоровью модели при сбоях; стоимость кэш-пролива в длинных агентных сессиях роутер тоже учитывает при выборе. В агентном сценарии на 97 задачах cloudflare/auto показал точность 86,6% (252 из 291 успешных попыток) при затратах 0,0084 доллара за успешную задачу; для сравнения, Claude Opus 5.5 достиг 96,6% при 0,0210 доллара, а GPT-6 Sol — 84,2% при 0,0108 доллара. По самоотчёту Cloudflare, внутреннее использование роутера дало до 30% экономии относительно топовых моделей.
Контекст
AI Gateway — это шлюз Cloudflare, через который приложения получают доступ к разным провайдерам моделей через единый прокси, поэтому решение о том, какую модель вызывать, раньше целиком оставалось в коде приложения: инженеру приходилось заранее классифицировать задачи и в одних местах ставить недорогую модель, а в других — флагман. Ошибка в обе стороны стоит денег: переплата за флагман на тривиальных запросах или потеря качества там, где он действительно нужен. Отдельный слой сложности создают длинные агентные сессии: подмена модели обнуляет кэш промпта, и контекст приходится заново оплачивать при каждом переключении, поэтому кэш-осведомлённость остаётся нетривиальным и редко учитываемым требованием к роутингу.
Почему это важно для индустрии
Для индустрии важна не столько сама утилита, сколько сдвиг точки принятия решения: AI Gateway из прокси превращается в управляющую плоскость, и выбор модели становится тарифно-качественной политикой шлюза, а не инженерной задачей в коде каждого приложения. Такой контрольный слой, через который проходят все запросы компании, дорожает относительно вендоров моделей, а конкуренция смещается от отдельных моделей к качеству роутинга, наблюдаемости и кэш-экономике. Для стартапов это означает падение себестоимости инференса на продуктах, где модель раньше фиксировалась константой. Если подход приживётся, жёсткая привязка к конкретной модели в коде рискует стать анти-паттерном, дифференциацию командам придётся искать выше роутинга, а задача-классификатор на границе сети имеет все шансы превратиться в стандартный элемент инфраструктуры — ответные функции у других шлюзов и роутеров выглядят ожидаемо.
Почему это важно для пользователей
Если трафик уже проходит через AI Gateway, проверка не требует перестройки приложения: достаточно заменить конкретную модель на «cloudflare/auto» и сравнить на своих реальных задачах точность, стоимость и латентность с ручным выбором — практичнее всего на некритичных сценариях вроде черновиков, классификации и суммаризации. Эффект зависит от структуры задач: на простых запросах цена весит больше и выигрывают малые модели, на сложных определяющим становится качество, и здесь роутер по цифрам вендора проигрывает флагманам. Поэтому ответственные продакшен-пути пока разумнее оставить на фиксированной модели, а тем, кому важнее максимальное качество без ценовых компромиссов, стоит дождаться запланированного профиля cloudflare/auto-best.
Что пока неизвестно / ограничения
Ключевые цифры взяты из внутреннего бенчмарка Cloudflare, и методология, список задач и калибровка классификатора не опубликованы, поэтому переносить результаты на чужие сценарии стоит осторожно. Латентность классификатора на границе сети и прайс после окончания беты пока не раскрыты. Цифра экономии по внутреннему использованию остаётся самоотчётом без описания выборки, а в бенчмарке сопоставляются только две названные модели. Сроки и условия выхода запланированного профиля cloudflare/auto-best не сообщены.
Источники
Автор
Look at AI, редакция
