Yandex B2B Tech запустила в своей СУБД YDB гибридный поиск: полнотекстовый индекс с ранжированием BM25 отвечает за точные совпадения, векторный — за поиск по смыслу, а слить результаты обоих можно одним SQL-запросом. Так классическая связка «основная база данных плюс отдельный поисковый движок плюс векторное хранилище» сжимается до одного стека без отдельной инфраструктуры поиска. Функция уже доступна в open source, в облачном managed-сервисе Yandex Cloud и в локальной установке on-premises.

image
image
image

Что произошло

Гибридный поиск вошёл в релиз YDB 26.3. Оба индекса — полнотекстовый с ранжированием BM25 и векторный — реализованы как распределённые сервисные таблицы YDB и обновляются в одной транзакции вместе с основными данными. В релизе также появилась SQL-функция HybridRank, объединяющая в одном запросе результаты BM25-поиска и векторного поиска, и улучшенный фильтруемый векторный индекс с параметром adaptive_clusters, который автоматически подбирает число кластеров. Компания открыла функцию в трёх формах поставки: в open source на ydb.tech, в Managed Service for YDB с 23 сентября, включая Serverless, и on-premises.

Контекст

Спрос на совмещение двух режимов поиска давний: BM25-ранжирование надёжно находит артикулы, имена и точные термины, а векторный поиск ловит перефразированные формулировки и близкие по смыслу фрагменты. Сам гибридный поиск — устоявшийся индустриальный подход с ограниченной научной новизной; главное здесь в другом — в том, где физически живут индексы. Командам, которым нужны оба режима (RAG-ассистенты, базы знаний, поддержка, каталоги), обычно приходится собирать и синхронизировать три раздельные системы — основную БД, поисковый движок и векторное хранилище; возникает окно рассинхронизации, когда записанная секунду назад строка ещё не видна в поисковом индексе, что напрямую бьёт по качеству RAG на свежих данных. К этому добавляются двойной переход «индекс → идентификатор → строка» при выборке и лицензии на каждое хранилище. Рынок на такие задачи отвечает ростом: по оценке Grand View Research, к 2028 году сегмент векторного и гибридного поиска может достичь $2–4 млрд, при этом сам вендор подаёт YDB как первую российскую СУБД со встроенным гибридным поиском.

Почему это важно для индустрии

Для строительных команд и компаний главный выигрыш — архитектурный: раз поисковые индексы обновляются в одной транзакции с основными данными, из стека RAG-приложений исчезают два отдельных компонента вместе с инфраструктурой их синхронизации, а вместе с ними и окно рассинхронизации, прямо влиявшее на свежесть ответов ассистентов. Команды получают возможность строить поисковые и RAG-продукты на одном стеке: для стартапов это сокращение операционных расходов и ускорение итераций, для существующих систем — сценарий консолидации трёх хранилищ в одну СУБД. Для Yandex Cloud это классический шаг по расширению ценности управляемой базы данных и удержанию нагрузок внутри своей экосистемы. Если транзакционные индексы подтвердят себя под продовой нагрузкой, гибридный поиск внутри SQL-СУБД может стать ожидаемым дефолтом для RAG-инфраструктуры, а конкуренция сместится от проверки «есть ли фича» к измеримым характеристикам — латентности, стоимости и качеству ранжирования.

Почему это важно для пользователей

Пробовать фичу можно сразу в любом из трёх форматов поставки. Прототип поиска по собственным документам или тикетам собирается стандартным SQL: полнотекстовый индекс создаётся обычным оператором ALTER TABLE с опцией USING fulltext_relevance и ранжированием BM25, а сводное ранжирование выдачи BM25 и векторного поиска выполняет функция HybridRank в одном запросе — отдельный поисковый движок и векторное хранилище прототипу не нужны. Тем, кто хочет увидеть сборку целиком, Yandex Cloud 15 октября проведёт вебинар «Быстро находите нужное с YDB»: за час там разбирают построение поиска по документам и тикетам с подключением ИИ-ассистента, регистрация открыта на странице вебинара.

Что пока неизвестно / ограничения

Проверить ключевые обещания по цифрам пока нельзя: в доступных материалах нет ни recall@k, ни латентности, ни пропускной способности, ни сравнений с pgvector, Elasticsearch или ClickHouse, поэтому заявления о быстроте и качестве ранжирования остаются декларациями. Транзакционность поисковых индексов как продуктовая особенность заявлена, но не показана на живых нагрузках, а методика слияния двух ранжирований в HybridRank не раскрыта. Все три основных источника — блог Yandex Cloud, статья сотрудника команды YDB на Хабре и страница вебинара — вендорские, независимых обзоров нет; формулировка про «первую российскую СУБД со встроенным гибридным поиском» — маркетинговая рамка, а методология оценки рынка от Grand View Research не раскрыта. Как транзакционные гибридные индексы поведут себя под продовым масштабом, покажут эксплуатация и сторонние замеры.

Источники

Автор

Look at AI, редакция