Команды Т-Технологий из экосистемы Т-Банка привезли на конференцию ACM RecSys 2026 в Миннеаполисе сразу три работы — это двадцатая конференция ACM по рекомендательным системам, она проходит с 27 сентября по 2 октября 2026 года. Главный практический релиз — открытая библиотека Scikit-Rank: она оборачивает нейросетевые ранжировщики в scikit-learn-совместимый интерфейс fit/predict и позволяет подставить нейросеть вместо CatBoost или LightGBM почти без изменений кода. Вторая работа — фреймворк кросс-сервисной персонализации Perseus, который объединяет сигналы пользователя из всех продуктов компании в одну модель, третья — метод ScaL³AE, делающий рекомендации с LLM-обогащением применимыми к миллионным каталогам. Код Scikit-Rank уже открыт на GitHub, реализация ScaL³AE выложена в анонимном доступе, так что заявленные результаты можно проверять на своих данных уже сейчас.

image
image
image

Что произошло

Т-Технологии (экосистема Т-Банка) представили на ACM RecSys 2026 — двадцатой конференции ACM по рекомендательным системам, которая проходит в Миннеаполисе с 27 сентября по 2 октября 2026 года, — сразу три работы. Первая — открытая библиотека Scikit-Rank, которая ставится через pip install scikit-rank: в неё упакованы нейросетевые ранжировщики DCN v2, FinalNet, FinalMLP, Destine и TabM, встроена обработка числовых и категориальных признаков, поддерживаются numpy, pandas и polars, а для обучения предлагается более 20 функций потерь, включая BPR, LambdaRank, ListMLE и CORAL. Библиотека рассчитана на предсказание CTR и ранжирование предложений. Вторая работа — Perseus, Python-фреймворк, который строит одну общую последовательность событий пользователя из разных сервисов: просмотры, покупки, поиски и транзакции собираются вместе вместо логов отдельного продукта. Третья работа — статья про ScaL³AE «Scaling LLM-Enhanced Linear Autoencoders to Industrial-Size Catalogs»: метод заменяет плотные n×n-матрицы линейных автоэнкодеров L³AE низкоранговым разложением семантической матрицы сходства и разреженной аппроксимацией SANSA.

Контекст

RecSys — ежегодная конференция ACM, целиком посвящённая рекомендательным системам; в 2026 году проходит её двадцатый выпуск, и доклады там проходят экспертное рецензирование. Симптоматично, что все три работы Т-Технологий отвечают на застарелые боли этого рынка. Первая: продовое ранжирование — от подбора предложений до предсказания CTR — годами держалось на градиентном бустинге, поскольку нейросетевые модели требовали собственной обучающей обвязки и были дороги в сопровождении. Вторая: в экосистемах с несколькими приложениями персонализация обычно обучается отдельно под каждый продукт, и сигналы пользователя из соседних сервисов пропадают. Третья: когда рекомендации обогащаются семантикой от LLM, всё упирается в память — плотные матрицы сходства товаров размера n×n растут квадратично и на миллионных каталогах перестают помещаться. Характерно, что часть ответов оформлена не одноразовыми экспериментами, а инструментами, которые можно взять в работу: библиотекой, фреймворком и масштабируемым методом.

Почему это важно для индустрии

Для отрасли главное здесь — резкое удешевление перехода с бустинга на нейросетевое ранжирование: командам, которые давно присматривались к нейроранжировщикам, но не хотели поддерживать самописное обучение на PyTorch, порог входа снижается до уровня замены классификатора в привычном API. Второй смысл — экосистемный: Perseus показывает измеримый выигрыш от объединения пользовательских сигналов всех продуктов компании в одну модель персонализации, по данным авторов, показатель T-ECD растёт с 16 до 39% в разных доменах. Для банков и экосистем с несколькими приложениями это готовый паттерн — одна персонализация на все сервисы вместо отдельных моделей под каждый продукт, который можно воспроизвести и измерить у себя. Наконец, ScaL³AE снимает квадратичную по памяти зависимость LLM-обогащённых рекомендаций и делает линейные автоэнкодеры с LLM-семантикой применимыми к миллионным каталогам; по данным авторов, выигрыш растёт именно на холодных и разреженных данных, то есть там, где классические подходы слабее всего.

Почему это важно для пользователей

Проверить всё это можно в день публикации. Scikit-Rank ставится одной командой pip install scikit-rank, работает на CPU и CUDA, а обучение запускается через PyTorch и Hugging Face Accelerate с поддержкой mixed precision и multi-GPU; репозиторий scikit-rank/scikit-rank открыт на GitHub. Самый быстрый первый шаг для команды — прогнать библиотеку на собственном датасете ранжирования и сравнить результат с работающим бустингом по качеству, скорости и стоимости. Код ScaL³AE выложен на anonymous.4open.science/r/scal3ae: его можно читать и запускать, например чтобы проверить метод на собственном каталоге товаров. Отдельная ценность для практиков RecSys — карта рабочих решений крупной российской экосистемы: по Scikit-Rank видно, какие архитектуры и какие функции потерь реально применяются в её продакшене, а Perseus на этом этапе полезен как проектный шаблон для проектирования собственной кросс-сервисной инфраструктуры данных.

Что пока неизвестно / ограничения

Все ключевые цифры здесь авторские, и внешней независимой проверки у них пока нет. Рост показателя T-ECD с 16 до 39% относится к Perseus: из открытых материалов не следует, что именно за ним стоит — recall@k, NDCG или онлайн A/B, и на какой базе рассчитан процент; к тому же заметная часть прироста, вероятно, объясняется самим появлением кросс-доменных сигналов, а не конкретной архитектурой. Сам Perseus оформлен как демо-доклад ACM RecSys 2026 — его цель показать работоспособность прототипа, а не дать методологически выверенный бенчмарк. Код ScaL³AE опубликован только в анонимизированном виде для рецензирования: для чтения и экспериментов он пригоден, для промышленной интеграции пока нет. Наконец, для Scikit-Rank ключевой вопрос ближайших месяцев — независимые сравнения с градиентным бустингом на публичных CTR-датасетах: без них непонятно, станет ли библиотека рабочим инструментом миграции или останется обёрткой «для экспериментов».

Источники

Автор

Look at AI, редакция