DeepSeek выложила в открытый доступ экспериментальную мультимодальную модель DeepSeek-V4-Flash-Vision-Exp: чекпоинт на 305 млрд параметров (MoE) появился на Hugging Face 31 августа 2026 года под лицензией MIT, всего через 10 дней после релиза текстовой V4-Flash. Модель умеет разбирать скриншоты, читать графики и работать с инструментами, а на ряде агентных бенчмарков уже вровень с закрытым Claude Opus 4.8. Разбираем, что это значит для индустрии и как попробовать модель уже сегодня.

image
image
image

Что произошло

31 августа 2026 года DeepSeek опубликовала на Hugging Face чекпоинт DeepSeek-V4-Flash-Vision-Exp — первую экспериментальную мультимодальную модель семейства V4 с 305 млрд параметров в MoE-архитектуре и лицензией MIT. От релиза текстовой V4-Flash её отделило 10 дней: к стеку V4-Flash надстроили визуальный энкодер с алайнером и дообучили модель на понимание изображений — разбор скриншотов, чтение графиков и работу с инструментами. По данным карточки модели, на агентном бенчмарке ApexBench она набрала 36,5 балла против 26,2 у предшественницы V4-Flash-0731, но это некорректное сравнение: старая модель просто игнорирует картинки во входе. Против Claude Opus 4.8 новинка выигрывает на Agents' Last Exam (27,3 против 25,7), ZeroBench (35,0 против 34,0) и DeepSWE (59,3 против 58,0), но уступает на ApexBench (36,5 против 39,4) и NL2Repo (57,7 против 69,7), а проигрываемые разрывы на отдельных бенчмарках достигают 12 баллов.

Контекст

Архитектурно это адаптация существующего стека, а не новая наука: DFlash-внимание, MoE, Hyper-Connections и спекулятивный DSpark остались от V4-Flash, зрение появилось за счёт визуального энкодера с алайнером и дообучения. Новизна — в скорости и открытости: DeepSeek впервые перенесла мультимодальность в открытую V4-линейку за 10 дней после текстовой версии, причём сделала ставку не на витринные картинки, а на агентные сценарии. Текстовые способности при появлении зрения в основном сохранены или выросли: Toolathlon-Verified 75,9 против 70,3 у предшественницы, NL2Repo 57,7 против 54,2, просела только Cybergym (75,3 против 76,7). Отсутствие катастрофического забывания — важный сигнал, что зрение встроено без деградации текстовых навыков, хотя эти цифры пока представлены самим вендором и ждут независимой проверки.

Почему это важно для индустрии

Для индустрии появился открытый строительный блок для vision-агентов: веса под MIT на 305 млрд параметров с визуальным энкодером, поддержка vLLM и SGLang, плюс API-доступ. Стартапам и командам агентов больше не нужен контракт с закрытым вендором, чтобы дать агенту зрение, — издержки эксперимента падают до инженерного времени. Для конкурентов релиз усиливает ценовое давление на закрытые мультимодальные API вроде Claude Opus 4.8, ведь открытая модель проигрывает ему лишь в пределах 1–3 баллов на части бенчмарков. Если DeepSeek сохранит темп, защищённость продуктов сместится из доступа к модели в данные, дистрибуцию и интеграцию: когда «показать экран агенту» станет дефолтным слоем автоматизации, выигрывать будет тот, у кого лучше данные и интеграция, а не эксклюзивный доступ к модели.

Почему это важно для пользователей

Веса можно скачать с Hugging Face и запустить локально в квантованном виде: есть сборки под llama.cpp, LM Studio и Ollama. Без своего железа модель доступна через DeepSeek API в OpenAI-совместимом формате с блоками image_url; документация описывает лимиты — до 600 картинок на запрос, около 384 токенов на изображение, форматы JPEG, PNG, GIF и WebP. Прототип vision-агента — разбор скриншотов или отчётов — собирается уже сегодня, а минимальный PyTorch-инференс из репозитория позволяет заглянуть внутрь визуального энкодера и DFlash-внимания. Обладателям железа класса B200 SGLang предлагает запуск со спекулятивным декодированием DSpark на одной ноде. Переводить боевые пайплайны на чекпоинт пока рано — он позиционируется как экспериментальный.

Что пока неизвестно / ограничения

Прирост на ApexBench (плюс 10,3 пункта к V4-Flash-0731) методологически пустой: старая модель не поддерживает изображения во входе, так что это демонстрация работоспособности визуального контура, а не рост capabilities. Победы над Claude Opus 4.8 на Agents' Last Exam, ZeroBench и DeepSWE получены с отрывом 0,6–1,6 балла, но в источниках нет числа прогонов, разброса и описания eval-протокола — такие разницы лежат в пределах шума, и «обходит Opus 4.8» остаётся точечной оценкой, а не подтверждённым преимуществом. Чекпоинт экспериментальный, цены API не раскрыты, цифры бенчмарков представлены самим вендором и требуют независимой репликации; ожидается стабилизированная не-Exp версия с исправленными регрессиями.

Источники

Автор

Look at AI, редакция