🤖 Выпуск мультимодальной модели GLM-5.2-Vision-NVFP4
Представлена новая модель, объединяющая текстовый бэкбон GLM-5.2 и визуальный энкодер MoonViT от Kimi-K2.6. Модель оптимизирована под формат NVFP4 для работы на архитектуре NVIDIA Blackwell и поддерживает контекст до 1 млн токенов.
🌍 Демонстрирует возможности глубокой интеграции визуальных и текстовых компонентов через специализированные проекторы и оптимизацию под новые форматы данных (NVFP4), что критично для следующего поколения VLM на железе Blackwell.
👤 Позволяет работать с огромным контекстом (1 млн токенов), включая детальный анализ изображений высокого разрешения, используя современные методы квантования для ускорения инференса.
Источник 1: https://huggingface.co/baseten/GLM-5.2-Vision-NVFP4
