💻 Hetzner запустила экспериментальный API для инференса LLM, работающий по протоколу OpenAI.

На данный момент доступна модель Qwen/Qwen3.6-35B-A3B-FP8 (MoE с 3B активными параметрами) с контекстным окном 262K. Тесты показывают высокую производительность: задержка первого токена (TTFT) составляет 153 мс, а пропускная способность достигает 224 токенов в секунду.

🌍 Появление крупных инфраструктурных провайдеров вроде Hetzner на рынке инференса может привести к снижению стоимости вычислений и превращению LLM-инференса в низкомаржинавый инфраструктурный товар.

👤 Это отличная возможность протестировать современные модели через знакомый интерфейс OpenAI на альтернативном железе, что может быть выгоднее использования проприетарных API.

Источник 1: https://sliplane.io/blog/hetzner-inference