Представлена новая мультимодальная модель GLM-5.2-Vision-NVFP4, которая объединяет текстовый бэкбон GLM-5.2 с визуальным энкодером MoonViT от Kimi-K2.6 и оптимизирована для работы на новейшем оборудовании NVIDIA Blackwell.

image

Что произошло

Разработчики выпустили модель GLM-5.2-Vision-NVFP4, использующую формат NVFP4 и кастомный проектор PatchMerger. Это позволяет обрабатывать изображения с высоким разрешением (до 4096 токенов на картинку) и поддерживает сверхдлинный контекст объемом до 1 млн токенов.

Контекст

Данный релиз знаменует переход от универсальных мультимодальных моделей к специализированным решениям, которые глубоко интегрированы с конкретным аппаратным обеспечением через новые форматы данных и механизмы стыковки модальностей.

Почему это важно для индустрии

Для индустрии это сигнал о готовности программного обеспечения к работе с форматом NVFP4. Оптимизация под архитектуру Blackwell позволяет существенно повысить скорость инференса и снизить вычислительные затраты при обработке визуального контекста высокого разрешения.

Почему это важно для пользователей

Пользователи получают доступ к инструменту, способному проводить глубокий анализ огромных массивов визуально-текстовых данных. Это открывает возможности для создания высокопроизводительных мультимодальных агентов, способных работать в реальном времени с минимальными задержками.

Источники

Автор

Look at AI, редакция