Исследователи из EPFL представили MODUS — единую мультимодальную модель с архитектурой decoder-only, способную выполнять задачи любого типа преобразования (any-to-any). Модель, построенная на базе BAGEL-7B, использует гибридный подход с двумя экспертами для обработки различных типов данных внутри единой структуры.


Что произошло
Разработана архитектура MODUS, поддерживающая 16 различных модальностей. Модель использует 1D-эксперта для работы с дискретными токенами (текст, боксы) через авторегрессионное предсказание и 2D-эксперта для непрерывных пространственных данных (RGB, глубина, сегментация) с применением технологии flow matching. Это позволяет выстраивать цепочки преобразований, где результат одного этапа служит входными данными для следующего.
Контекст
В отличие от традиционных мультимодальных систем, которые полагаются на сложные каскады из множества отдельных энкодеров и декодеров, MODUS предлагает переход к единому унифицированному декодеру. В качестве основы была взята сильная языковая модель BAGEL-7B, что обеспечило качественное понимание текстовых инструкций.
Почему это важно для индустрии
Для индустрии это важный шаг к архитектурной унификации. Отказ от разрозненных модулей в пользу единого decoder-only блока упрощает разработку сложных ИИ-систем и снижает сложность интеграции новых модальностей. Применение flow matching внутри трансформера открывает новые возможности для высокоточного мультимодального синтеза данных.
Почему это важно для пользователей
Для конечных пользователей это означает повышение гибкости ИИ. Теперь можно создавать сложные рабочие процессы в рамках одной логической структуры — например, попросить модель превратить текст в карту глубин, а затем на основе этой карты сгенерировать реалистичное изображение, сохраняя высокую согласованность всех деталей.
Что пока неизвестно / ограничения
На текущем этапе проект является исследовательским. Для перехода к промышленной эксплуатации (production-ready) не хватает данных о задержке (latency), пропускной способности и стоимости инференса для поддержки всех 16 модальностей.
Источники
- MODUS — Decoder-only Any-to-Any Modeling of Diverse Modalities
- EPFL-VILAB/MODUS on GitHub
- EPFL-VILAB/MODUS on Hugging Face
Автор
Look at AI, редакция
