Solheim.ai запустил сервис Virtual Private LLM — выделенный LLM-инстанс на серверах в Европе по фиксированной ежемесячной подписке без счётчика токенов и ограничений по объёму запросов. Тарификация зависит от числа параллельных инстансов и размера контекстного окна, стартовая цена — €15/мес. Серверная инфраструктура расположена в европейских дата-центрах, запросы не покидают юрисдикцию ЕС.
Что произошло
Solheim.ai вывел сервис Virtual Private LLM, который предоставляет выделенный LLM-инстанс за фиксированную подписку. Тарификация идёт по двум параметрам: числу параллельных инстансов и размеру контекстного окна. Базовый план — €15/мес за один инстанс с контекстом 64k. На старте доступны две модели: Qwen3.6-35B-A3B с MoE-архитектурой (35B параметров, 3B активных на токен, лицензия Apache 2.0) и DeepSeek V4 Flash с лицензией MIT и контекстом 256k. API полностью совместим с OpenAI SDK, подключение к Cline, Roo Code и VS Code осуществляется заменой двух переменных окружения.
Контекст
Рынок LLM-инференса долгое время держался на модели токенов: платёж зависит от числа потреблённых токенов, а rolling usage window приводит к непредсказуемым расходам и внезапным блокировкам в середине сессии — например, Claude Code может остановиться из-за превышения лимитов. Solheim предлагает альтернативу по принципу rent the machine, not the tokens — вы арендуете вычислительный ресурс, а не платите за каждый токен. Архитектура MoE у Qwen3.6-35B-A3B теоретически обеспечивает эффективный инференс за счёт активации около 9% параметров на токен, что обосновывает экономику фиксированной подписки при круглосуточной доступности.
Почему это важно для индустрии
Сервис закрывает проблему суверенитета данных при инференсе: запросы остаются в юрисдикции ЕС, что покрывает требования GDPR и EU AI Act без участия инфраструктуры под действием CLOUD Act США. Паттерн VPS for LLMs может стать стандартом для EU-first AI-продуктов. Если концепция rent the machine распространится, это создаст давление на pricing US-хиперскейлеров и может сместить индустрию от token-based к instance-based тарификации, особенно для open-weight моделей.
Почему это важно для пользователей
Для команд, которым нужен предсказуемый LLM-бэкенд для coding-агентов, автоматизации или прототипов, Solheim даёт OpenAI-совместимый API от €15/мес с европейским compliance. Переключение с другого провайдера занимает минут — достаточно заменить API key и base_url. Open-weight модели Qwen3.6 и DeepSeek V4 Flash уступают Claude и GPT на сложных задачах, но для типовых dev-задач (diffs, тесты, рефакторинг, tool-calling) работают достаточно хорошо. Предсказуемая цена устраняет сюрпризы в биллинге, которые возникают при token-based моделях.
Что пока неизвестно / ограничения
Solheim не публикует бенчмарки производительности: токены в секунду, latency, time-to-first-token и SLA uptime остаются неизвестными. Нет данных об аппаратных спецификациях серверов — GPU-класс, количество карт, конфигурация инференс-стека (vLLM, TensorRT-LLM или другое) не разглашаются. Без этих параметров невозможно оценить, при каких нагрузках фиксированная цена остаётся рентабельной для провайдера и какое реальное качество инференса получают пользователи.
Источники
- Solheim — your own EU-hosted LLM instance
- Building Solheim: a VPS for LLMs, hosted entirely in the EU — Indie Hackers
- Show HN: Virtual Private LLM, fixed fee with no usage or token limits — Hacker News
Автор
Look at AI, редакция