💻 Dzen открыл код embedder для RAG — в 64 раза дешевле OpenAI

Компания Dzen (dzen.dev) открыла код dzen_embedder: сервис скачивает выбранную модель с Hugging Face и отдаёт OpenAI-совместимый эндпоинт /v1/embeddings. На GTX 1080 — около 248 фрагментов по 500 токенов в секунду.

🌍 Цена embedding-ов — редкая статья ИИ-расходов, где своё «железо» бьёт API по деньгам: сервер ≈ $100/мес против $6 400/мес у OpenAI (text-embedding-small) и $3 900/мес у Cloudflare Workers AI (bge-m3) при 640 млн фрагментов в месяц. Для high-volume RAG self-hosting с совместимым API становится дефолтом.

👤 Ставится за вечер на любой GPU или Mac на Apple Silicon: меняете base_url в коде, но качество локальной модели стоит проверить на своих данных. Данные не уходят наружу, тесты до 64 параллельных соединений прошли без ошибок. Лицензия 0BSD.

Источник 1: https://dzen.dev/blog/local-dzen-embedding-for-rag/ Источник 2: https://github.com/dzenplatform/embedder