Команда GigaChat (организация ai-sage на Hugging Face) выпустила в открытом доступе новое поколение эмбеддинг-моделей Giga-Embeddings-instruct в трёх размерах — 480M, 3B и MoE-флагман 10B-A1.8B — все под лицензией MIT. Модели переводят текст в векторы для RAG и семантического поиска и уже доступны для скачивания на Hugging Face.

image
image
image

Что произошло

Модели линейки используют двунаправленное (encoder-style) внимание и контрастивное обучение с потерей InfoNCE. 480M и 3B построены на архитектуре Qwen3, а флагман 10B-A1.8B — на DeepSeek-V3 с MLA и MoE: 64 эксперта, 4 активных на токен, около 1,8 млрд активных параметров из 10 млрд общих. По данным модельных карточек, 10B-A1.8B набирает 74,99 в MTEB (рус.) и выдаёт до 114,5 тыс. токенов в секунду на H100 под vLLM, опережая Qwen3 Embedding 4B, Nemotron 8B и F2LLM-v2-8B. Модель 3B подняла MTEB (code) с 62,37 до 76,93 — прирост 14,56 пункта, а 480M получила 70,98 в MTEB (rus, v1.1), обойдя крупнее по размеру FRIDA-820M.

Контекст

Релиз — не новая архитектура: базовые модели Qwen3 и DeepSeek-V3 являются публичными, а команда адаптировала и дообучила их под задачу эмбеддингов; новизна заключается в тренировочном рецепте, включая дистилляцию от младшей версии модели, а не в самой архитектуре. Эмбеддинг-модели — ключевой компонент RAG-систем и семантического поиска: они представляют текст в виде векторов, позволяя искать в корпусе по смыслу, а не по ключевым словам. До этого выпуска топовые русскоязычные эмбеддинги в основном были привязаны к закрытым или платным решениям, а среди открытых вариантов были более слабые. Разреженное MoE-внимание, которое использует флагман, — распространённый способ получить качество большой модели при стоимости инференса компактной.

Почему это важно для индустрии

Для отрасли это первые открытые русскоязычные эмбеддинг-модели топового уровня под MIT, которые можно встроить в продукт напрямую, без платного API и привязки к вендору. Для product-команд это готовый критичный компонент локальных RAG-стеков и корпоративного поиска в трёх ценовых тирах. MoE-флагман даёт качество уровня 10B-модели при стоимости инференса около 1,8 млрд активных параметров, что делает плотный поиск по большим корпусам заметно дешевле. После того как поддержка в vLLM и SGLang попадёт в стабильные релизы, линейка может стать дефолтным открытым русскоязычным эмбеддингом для RAG, а конкуренты, включая платные API, будут вынуждены обосновывать свои цены.

Почему это важно для пользователей

Все три модели уже можно скачать на Hugging Face: 480M и 3B запускаются через sentence-transformers, это стабильный путь, а 10B-A1.8B — через vLLM из сборки main или nightly либо через SGLang: PR #52948 уже влит в main-ветку vLLM, но в релиз ещё не попал, поддержка в SGLang приходит через PR #35531. Для компактного русского поиска подойдёт 480M, для задач с кодом — 3B, а для максимального качества и мультиязычности — флагман 10B-A1.8B. Существующим RAG-системам перед внедрением имеет смысл прогнать A/B-сравнение с текущими эмбеддингами.

Что пока неизвестно / ограничения

Оценочная база смешанная и самоотчитанная в модельных карточках: 480M оценена в MTEB (rus, v1.1), а для флагмана 10B-A1.8B версия бенчмарка не указана. Прирост 14,56 пункта 3B в MTEB (code) — сравнение с предыдущим поколением самой же команды, а не с конкурентами, и утверждение о первом месте в ruMTEB взято из карточки и требует проверки по лидерборду. Сравнение скорости флагмана с Qwen3 Embedding 4B, Nemotron 8B и F2LLM-v2-8B не раскрывает условий измерений — размер батча, длину последовательности, квантование, — и сопоставление MoE-модели с 1,8 млрд активных параметров с плотными моделями 4B и 8B по пропускной способности корректно проводить сложно.

Источники

Автор

Look at AI, редакция