🤖 DeepSeek открыла веса мультимодальной V4-Flash-Vision-Exp

На Hugging Face выложен экспериментальный чекпоинт на 305 млрд параметров (MoE) под лицензией MIT — через 10 дней после релиза текстовой V4-Flash. К архитектуре V4-Flash добавили визуальный энкодер: модель разбирает скриншоты, читает графики и работает с инструментами.

🌍 Первая мультимодальная модель открытой линейки V4, ориентированная на агентов: на ApexBench — 36,5 против 26,2 у текстовой V4-Flash-0731 (та картинок не видит), на Agents' Last Exam и ZeroBench она обходит Claude Opus 4.8, но на части задач уступает.

👤 Веса можно скачать и запустить локально — есть квантованные сборки под llama.cpp, LM Studio и Ollama. Без своего железа — через DeepSeek API (OpenAI-совместимый формат с image_url, до 600 картинок на запрос).

Источник 1: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp Источник 2: https://api-docs.deepseek.com/guides/vision/