Представлено семейство мультимодальных моделей TimeLens2 (размером 4B и 8B параметров), которые специализируются на задаче temporal grounding — точном поиске нужных моментов в видео по текстовому описанию.



Что произошло
Разработаны модели TimeLens2, способные работать с длинными видеороликами, распознавать повторяющиеся события и понимать как видео от третьего лица, так и эгоцентрические записи (POV). Для обучения моделей использовался метод GRPO в сочетании с функцией Temporal Wasserstein reward, что позволило значительно повысить точность определения границ событий.
Контекст
Проблема точного определения временных границ (temporal grounding) является критической для Vision Language Models (VLM). Переход от простого описания содержания видео к поиску конкретных интервалов требует специализированных архитектур и новых методов оптимизации пространственно-временных связей.
Почему это важно для индустрии
Появление специализированных и доступных моделей позволяет автоматизировать разметку видеоданных и улучшить навигацию в огромных архивах. Использование методов обучения с подкреплением (GRPO) и новых функций потерь (Wasserstein) задает новый стандарт оптимизации VLM для работы с временной шкалой.
Почему это важно для пользователей
Пользователи получают возможность быстро находить конкретные сцены в длинных роликах с помощью простых текстовых запросов (например, «момент, когда машина поворачивает»). Это открывает новые возможности для видеомонтажа, систем видеонаблюдения и автоматизированного анализа обучающих данных.
Источники
Автор
Look at AI, редакция
