Компания Dzen открыла код dzen_embedder — Python-сервиса для локальных текстовых embeddings в поиске RAG. Он скачивает выбранную модель с Hugging Face и поднимает эндпоинт /v1/embeddings, совместимый с OpenAI API. По расчётам авторов, один сервер со старой видеокартой GTX 1080 покрывает заявленный объём индексации примерно за $100 в месяц, тогда как тот же объём через OpenAI обходится в $6 400. Репозиторий опубликован под лицензией 0BSD.

Что произошло
31 августа 2026 года компания Dzen опубликовала на GitHub репозиторий dzenplatform/embedder с кодом сервиса dzen_embedder. Это Python-приложение, которое скачивает выбранную embedding-модель с Hugging Face и разворачивает локальный эндпоинт эмбеддингов с контрактом OpenAI API. Внутри реализованы две очереди обработки: вопросы посетителей идут с приоритетом, а индексация сайта выполняется на свободных мощностях. В бенчмарке авторов одна GTX 1080 обрабатывает около 248 фрагментов по 500 токенов в секунду, а нагрузочные тесты с 64 параллельными соединениями на GPU и Mac на Apple Silicon прошли без ошибок.
Контекст
Embeddings лежат в основе RAG-поиска: документы нарезаются на фрагменты, переводятся в векторы, и по этим векторам находится контекст для запросов к языковой модели. Каждая переиндексация означает прогон миллионов фрагментов через модель, поэтому при больших объёмах оплата API-эмбеддингов превращается в заметную статью расходов на уровне тысяч долларов в месяц. При этом embedding-модели малы по сравнению с генеративными: они запускаются на обычном потребительском железе, так что self-hosting здесь финансово оправдан заметно чаще, чем в случае больших моделей. Дополнительный фактор — унификация API: рынок де-факто стандартизировался на формате OpenAI, поэтому локальный сервис с таким же контрактом встраивается в готовые пайплайны почти без переделок.
Почему это важно для индустрии
Для ИИ-команд embedding — одна из немногих статей расходов, где собственное железо и открытые модели стабильно выигрывают у API-провайдеров по деньгам. По расчётам авторов, при 640 млн фрагментов в месяц соотношение к дорогому тарифу OpenAI достигает 1:64, а Cloudflare Workers AI с моделью bge-m3 при том же объёме стоит $3 900 в месяц. Это изменяет unit-экономику high-volume RAG: сценарии с постоянной переиндексацией больших корпусов, которые раньше не сходились по деньгам, становятся посильными для продакт-команд, а self-hosting с OpenAI-совместимым эндпоинтом превращается в дефолтный выбор для больших объёмов. Провайдерам в этом сегменте остаётся конкурировать удобством и качеством универсальных моделей.
Почему это важно для пользователей
Практическая выгода для читателя-инженера осязаема: при наличии любого GPU (в бенчмарке авторов — старая GTX 1080) или Mac на Apple Silicon сервис разворачивается за один вечер. Модель выбирается по лидерборду MTEB и скачивается с Hugging Face, локальный эндпоинт поднимается рядом, а существующий код переключается с OpenAI API заменой base_url. Отдельный плюс — данные перестают покидать вашу инфраструктуру, что снимает вопрос о передаче наружу содержимого внутренних баз и документов. Перед переключением продакшена разумно прогнать собственные evals релевантности на имеющемся корпусе, чтобы убедиться, что новая модель не просела.
Что пока неизвестно / ограничения
Релизу одни сутки, независимых проверок нет: обсуждение на Hacker News находится на одном балле и без комментариев. Бенчмарк — vendor-замер на собственном профиле нагрузки: цифру 248 фрагментов в секунду пока не воспроизводили третьи стороны, а параметры батчинга, точности FP16/FP32/INT8, конфигурации и перцентили латентности авторы не раскрывают. Заявленный объём 640 млн фрагментов в месяц достигается впритык: из данных бенчмарка следует, что одна GTX 1080 при непрерывной работе покрывает около 650 млн фрагментов, то есть запаса на простои нет. Точка безубыточности между self-hosting и API по объёму в статье не рассчитана, поэтому при небольших объёмах фиксированная стоимость сервера и операционные расходы выравнивают баланс. Наконец, замена base_url меняет контракт API, но не гарантирует, что выбранная локальная модель сопоставима с text-embedding-small по качеству retrieval — это нужно проверять отдельным сравнением.
Источники
- Блог Dzen: Run local embedder for less than 1% of a big AI provider's price
- Репозиторий dzenplatform/embedder на GitHub
Автор
Look at AI, редакция
