Крупный инфраструктурный провайдер Hetzner начал тестирование собственного API для инференса больших языковых моделей. Решение совместимо с протоколом OpenAI и предлагает высокую производительность на базе моделей семейства Qwen.


Что произошло
Hetzner представила экспериментальный API, поддерживающий модель Qwen/Qwen3.6-35B-A3B-FP8. Это архитектура MoE (Mixture-of-Experts), где из 35 млрд общего числа параметров в каждый момент времени активны только 3 млрд. Тесты демонстрируют задержку первого токена (TTFT) на уровне 153 мс и пропускную способность до 224 токенов в секунду при поддержке контекстного окна в 262K токенов.
Контекст
Выход Hetzner на этот рынок знаменует переход от специализированных AI-стартапов к крупным традиционным хостинг-провайдерам. Использование архитектуры MoE позволяет эффективно распределять вычислительные ресурсы, обеспечивая скорость, сопоставимую с решениями для задач с низким временем отклика.
Почему это важно для индустрии
Приход таких игроков, как Hetzner, может превратить LLM-инференс в низкомаржинальный инфраструктурный товар (commodity). Это усилит конкуренцию среди облачных провайдеров, потенциально снижая стоимость вычислений и вынуждая специализированных поставщиков услуг искать новые способы защиты прибыли.
Почему это важно для пользователей
Разработчики получают возможность использовать современные open-weights модели через привычный интерфейс OpenAI на альтернативной инфраструктуре. Это может быть значительно выгоднее использования проприетарных API и упрощает деплой моделей с минимальными изменениями в существующем коде.
Что пока неизвестно / ограничения
Существуют потенциальные риски, связанные с корпоративным соответствием и безопасностью данных при использовании альтернативного облачного провайдера, которые требуют отдельной оценки для enterprise-сегмента.
Источники
Автор
Look at AI, редакция
