Немецкая некоммерческая группа LAION вместе с Тюбингенским AI-центром, University of Tübingen и Forschungszentrum Jülich выпустила открытый видеодатасет LAION-BVD: 80 млн скачанных видео суммарной длительностью 10 млн часов, нарезанных на 55 млн клипов, плюс 300 млн кадров и две аудиовыборки на 1,7 млн и 10 млн дорожек. Облегчённые версии с URL и метаданными уже свободно лежат на Hugging Face, полные с медиафайлами выдаются по заявке и только для исследований. По данным статьи arXiv:2608.24845, модели ViCLIP и CLAP, обученные на BVD, сопоставимы с обученными на InternVid и превосходят их на видеотекстовых бенчмарках до +2,1%.


Что произошло
LAION-BVD (Big Video Dataset) собран из 1,3 млрд ссылок в архивах CommonCrawl, по которым удалось скачать 80 млн роликов суммарной длительностью 10 млн часов. Контент-aware детекция смен сцен нарезала материал на 55 млн клипов (выборка BVD-V-55M), к которым построены синтетические описания видео и аудио. Отдельно извлечены 300 млн кадров (BVD-I-300M) и две аудиовыборки на 1,7 млн и 10 млн дорожек (BVD-A-1.7M и BVD-A-10M). Релиз описан в статье arXiv:2608.24845 от 25 августа 2026. Облегчённые версии всех подвыборок — только URL и метаданные, включая BVD-URLs на 1,35 млрд записей и BVD-V-55M-URLs — открыты на Hugging Face, а полные версии с медиафайлами выдаются по заявке.
Контекст
До сих пор корпуса такого масштаба для мультимодального пре-тренинга были сосредоточены у проприетарных компаний, и открытому научному сообществу приходилось работать на заметно меньших данных. BVD впервые открывает корпус в 10 млн часов сразу в трёх модальностях: видео-текст для ViCLIP, аудио-текст для CLAP и изображение-текст для CLIP-стиля моделей. Отдельного внимания заслуживают кадры из видео: они несут распределение с реальными ракурсами, движением и композициями, которого нет в фотобанках. Научный сигнал релиза тоже содержательный: модели ViCLIP и CLAP, обученные на BVD, на видеотекстовых бенчмарках превосходят обученные на InternVid до +2,1%, а при масштабировании с 10 млн до 50 млн клипов качество растёт отчётливо — то есть кривая «данные против качества» не насытилась, и её теперь можно измерять в открытом цикле так же, как корпоративные.
Почему это важно для индустрии
Для индустрии главный эффект — удешевление входа в мультимодальное видео: корпус масштаба big tech теперь доступен не только закрытым командам, поэтому R&D-фаза видео-текстового и аудио-текстового поиска, аудиокатегоризации и агентских пайплайнов «просмотра» перестаёт требовать проприетарных данных. Открытая кривая масштабирования позволяет командам измерять отдачу от данных на своих evals и планировать пре-трейн с опорой на воспроизводимую зависимость от числа клипов. Ожидаемо в ближайшие месяцы появятся независимые воспроизведения сравнения с InternVid, открытые чекпоинты ViCLIP и CLAP, обученные на BVD, производные работы на подвыборках и инструменты фильтрации и дедупликации вокруг URL-корпуса. При этом research-only лицензия делает датасет для стартапов контуром прототипирования: продуктовый релиз на его основе потребует либо другой лицензии, либо собственной выгрузки данных, и спрос на лицензируемые коммерческие корпуса при таком раскладе с высокой вероятностью вырастет.
Почему это важно для пользователей
Если вы хотите обучить или дообучить свою видео- или аудиомодель, попробовать можно уже сегодня: скачайте URL-версии подвыборок с Hugging Face, отфильтруйте корпус под свою задачу, соберите пилотное дообучение в стиле ViCLIP или CLAP на 10-миллионной клиповой подвыборке и сравните результат с текущей baseline-моделью на своих evals — это проверка гипотезы без затрат на закрытые данные. Параллельно можно подать заявку на полные версии с медиафайлами через анкету проекта. Два практических ограничения: лицензия разрешает только исследовательское применение, так что коммерческий продукт на этих данных собирать нельзя, а работа с URL-версией означает собственный этап скачивания роликов по внешним ссылкам со всеми последствиями для битых адресов.
Что пока неизвестно / ограничения
Прирост до +2,1% над InternVid без доверительных интервалов и независимой репликации корректно читать как паритет с небольшим преимуществом, а не как разрыв. URL-версия не равна корпусу: между метаданными и обучением лежит этап скачивания 80 млн роликов по внешним ссылкам, который без детального описания не воспроизводится по умолчанию. Полные медиафайлы выдаются по заявке, а не свободно, и лицензия строго research-only. Проверить стоит и стабильность ресурса в долгую: кто и как будет поддерживать такой масштаб corpus, из статьи не следует.
Источники
- LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training (arXiv:2608.24845)
- LAION-BVD — официальный проектный сайт
- BVD: Big Video Dataset — коллекция датасетов на Hugging Face
Автор
Look at AI, редакция
