Исследователи Т-Технологий представили датасет T-ECD в основной программе конференции ACM KDD 2026 в Южной Корее. Набор содержит более 135 млрд анонимизированных взаимодействий из пяти доменов банковской экосистемы — маркетплейс, ритейл, платежи, спецпредложения и отзывы — и опубликован на Hugging Face под лицензией Apache 2.0. Отчет показал, что кросс-доменные данные улучшают рекомендации на 31,5% для промоакций, но ухудшают их на 25,5% для продуктов питания, что ставит под вопрос универсальность мультидоменных моделей.


Что произошло
Технический отчет по датасету T-ECD (T-Tech E-commerce Cross-Domain Dataset) вошел в основную программу 32-й конференции ACM SIGKDD 2026. Датасет собран на основе данных банковской экосистемы «Т-Банка» и включает 44 млн пользователей, 30 млн товаров и пять доменов взаимодействия. 92,6% пользователей взаимодействуют как минимум с двумя доменами. После синтетической анонимизации абсолютное значение Recall@200 снижается на 20–35%, но относительный ранг моделей сохраняется. Бенчмарки охватывают модели от ALS до HSTU и показывают эффект кросс-доменных данных: улучшение на 31,5% для промоакций, на 13,3% для непродовольственных товаров и падение на 25,5% для продуктов питания. Датасет доступен в полной версии (2,81 ТБ) и small-версии (~1 млрд взаимодействий, ~3,5 млн пользователей) на Hugging Face, код бенчмарков — в репозитории tecd-baselines.
Контекст
Открытые датасеты промышленного масштаба для рекомендательных систем — редкость. Существующие наборы вроде Amazon Review Data или Taobao чаще ориентированы на один домен или не предоставляют полный воспроизводимый пайплайн с кодом. T-ECD выводит в топ открытых индустриальных датасетов сопоставимо по размеру с Amazon Review и Taobao. Публикация в основной программе ACM KDD — ведущей конференции по data mining и knowledge discovery — подтверждает научную значимость работы. Лицензия Apache 2.0 не накладывает ограничений на коммерческое использование, что отличает T-ECD от датасетов с образовательными лицензиями.
Почему это важно для индустрии
T-ECD создает индустриальный бенчмарк для кросс-доменной персонализации. Кросс-доменная структура (92,6% пользователей в 2+ доменах) открывает задачи transfer learning и мультидоменной персонализации, актуальные для MultiApp-платформ и экосистемных продуктов. Результат по отрицательному переносу до −25,5% для FMCG критичен для индустриального применения: он показывает, что кросс-доменные данные не всегда улучшают рекомендации, что противоречит упрощенному нарративу «больше данных — лучше». Это ставит перед исследовательскими командами задачу адаптивного кросс-доменного fusion, который учитывает доменную специфику. Для RecSys-стартапов открытый доступ к датасету снижает стоимость R&D и предоставляет baseline, против которого можно валидировать собственные модели.
Почему это важно для пользователей
Small-версия датасета (~1 млрд взаимодействий, ~3,5 млн пользователей) работает без GPU — её можно скачать с Hugging Face и использовать на CPU для проверки гипотез и обучения рекомендательных моделей. Репозиторий tecd-baselines с кодом бенчмарков (ALS, NCF, SASRec, HSTU) позволяет воспроизвести результаты из отчета и сравнить свои модели с индустриальным стандартом. Для студентов и исследовательских групп это моментальный доступ к реалистичным промышленным данным без необходимости развертывания GPU-инфраструктуры.
Что пока неизвестно / ограничения
Набор бенчмарков охватывает четыре модели из разных поколений (ALS, NCF, SASRec, HSTU), но отсутствуют современные архитектуры на основе графовых нейронных сетей и трансформеров, такие как LightGNN, SimGCL, B4Rec. Это ограничивает научную строгость утверждений о воспроизводимости результатов. Абсолютное падение Recall@200 на 20–35% после анонимизации указывает на потерю информации, которая может быть систематической — методология синтетической анонимизации и ее влияние на специфические группы пользователей требуют дополнительного изучения.
Источники
- CNews — Исследователи «Т-Технологий» представили технический отчет о датасете T-ECD
- t-tech/T-ECD — страница датасета на Hugging Face
- T-ECD: A Large-Scale Cross-Domain E-Commerce Dataset for Industrial Recommender Systems — публикация в ACM KDD 2026
Автор
Look at AI, редакция
