Компания LTX, выделенная из Lightricks, выпустила видео- и world-модель LTX-2.5 на 22 миллиарда параметров с open-weights лицензией. Модель генерирует 10-секундные клипы 720p за 6,8 секунды на двух GPU NVIDIA GB200, что в 7,6–10,4 раза быстрее проприетарных Gemini Omni Flash и Veo 3.1. Дистиллированная версия работает на GPU от 16 ГБ VRAM, а с первого дня доступна интеграция с ComfyUI.

image
image

Что произошло

Релиз LTX-2.5 включает ряд архитектурных изменений. Вместо традиционного VAE reconstruction применён diffusion video decoder — нетривиальная замена, направленная на устранение артефактов и узких мест качества в видео-диффузии. Текст обрабатывается кастомным text encoder на базе Gemma 4 12B, что отходит от стандартных CLIP и T5 подходов. Модель поддерживает нативную мультикадровую генерацию, prompt enhancer, text-to-video, image-to-video и генерацию синхронизированного аудио в одном проходе. Дистиллированная версия требует от 16 ГБ VRAM. Комьюнити уже выпустило NVFP4-квантизированную версию от BennyDaBall — 18,7 ГБ вместо 21,5 ГБ INT8, работающую на Blackwell и RTX 50-серии. Lightricks также опубликовала официальный IC-LoRA Pixel Spatial Upscaler x2 для генеративного повышения разрешения с синтезом деталей.

Контекст

LTX — компания, выделенная из Lightricks, известного разработчика мобильных инструментов для работы с фото и видео. Запуск LTX-2.5 как open-weights модели с лицензией, бесплатной для компаний с выручкой до 10 миллионов долларов ARR, позиционирует видео-генерацию как базовую инфраструктуру, а не конкурентное преимущество. CEO LTX Zeev Farbman описал интеграцию с ComfyUI как основной канал привлечения клиентов. Модель доступна на Hugging Face, комьюнити быстро адаптировало её: квантизация, специализированные LoRA, интеграция в существующие пайплайны — всё это уже в работе.

Почему это важно для индустрии

Скорость 6,8 секунды на 2× GB200 против 52–70 секунд у Gemini Omni Flash и Veo 3.1 — это сдвиг базовой линии производительности в пользу open-source решений. Замена VAE на diffusion decoder может стать winning approach для всего поколения видео-моделей. Open-weights лицензия до 10 млн ARR позволяет стартапам запускать MVP видео-генерации без API-расходов, сокращая time-to-market с месяцев до недель. Архитектурный паттерн единой модели для видео и аудио, а также day-one поддержка ComfyUI, создают условия для формирования экосистемы по типу Stable Diffusion: LoRA для стилей, кастомные encoder-ы, интеграции в существующие creative tools. Однако зависимость от Blackwell-архитектуры для максимальных результатов создаёт hardware lock-in.

Почему это важно для пользователей

Модель доступна для скачивания на Hugging Face. Дистиллированную версию можно запустить локально на GPU от 16 ГБ VRAM. На RTX 50-серии и Blackwell работает NVFP4-квантизация от BennyDaBall, снижающая объём памяти до 18,7 ГБ. Oфициальный IC-LoRA Upscaler позволяет повышать разрешение генеративным способом, а не интерполяцией. Интеграция с ComfyUI работает с первого дня, что даёт готовые воркфлоу без необходимости писать код. Поддерживаемые режимы: text-to-video, image-to-video, мультикадровые сцены и синхронизированное аудио.

Что пока неизвестно / ограничения

Техническая публикация по LTX-2.5 отсутствует. Метрики качества видео — FVD, FID, человеческие оценки — не опубликованы. Заявленная скорость 6,8 секунды измерена на двух GPU NVIDIA GB200, и бенчмарк воспроизводим только на Blackwell-архитектуре, что делает сравнение с Gemini Omni Flash и Veo 3.1 методологически слабым — условия инференса могут отличаться. Архитектура кастомного text encoder на базе Gemma 4 12B не описана: неизвестно, обучался ли он jointly с основной моделью или заморожен. Trade-off между скоростью и качеством при замене VAE на diffusion decoder пока не документирован. Утверждения о production readiness преждевременны без воспроизводимых метрик.

Источники

Автор

Look at AI, редакция