Компания LTX, спин-офф израильской Lightricks, 11 августа 2026 года выпустила LTX-2.5 — полностью переработанную открытую модель генерации видео, которая генерирует 10-секундный клип 720p за 6,8 секунды на двух GPU NVIDIA GB200, обгоняя закрытые аналоги от Google, xAI и OpenAI по скорости и качеству.


Что произошло
LTX анонсировала LTX-2.5 с тремя ключевыми обновлениями архитектуры. Диффузионный видеodecoder переработан заново: он уменьшает артефакты при высокой динамике сцены и восстанавливает мелкие детали, включая текст и лица. Модель получила нативную multishot-генерацию — возможность создавать связанные кадры с сохранением персонажа, окружения и голоса без постобработки и склейки. Языковое ядро заменено на кастомную Gemma 4 с prompt-enhancer для лучшего понимания сложных подсказок. API-цены: $0,09 в секунду за 720p, $0,15 за 1080p, $0,19 за 2K, $0,37 за 4K. Веса опубликованы на Hugging Face, лицензия бесплатна для организаций с выручкой до 10 млн долларов ARR. Поддержка ComfyUI интегрирована с первого дня.
Контекст
Семья моделей LTX набрала свыше 33 миллионов скачиваний за всё время. LTX — спин-офф Lightricks, израильской компании-разработчика Facetune. Предыдущие версии LTX уже показали, что open-weights модели видеогенерации могут конкурировать с закрытыми решениями по качеству. Индустрия AI-видео доминировалась проприетарными API от крупных облачных провайдеров — Google с Veo и Gemini Omni Flash, xAI с Grok, Sora от OpenAI. LTX-2.5 продолжает стратегию открытых весов, заложенную Stable Diffusion для изображений, но масштабирует её на видео.
Почему это важно для индустрии
LTX-2.5 — первый open-weights видеогенератор со скоростью 6,8 секунды на 10-секундный клип, что существенно быстрее закрытых конкурентов: Gemini Omni Flash генерирует 8 секунд за 52 секунды, Grok 1.5 — за 63 секунды, Veo 3.1 — за 70 секунд. В слепых человеческих тестах LTX-2.5 выигрывает в 67% случаев, опережая Seedance 2.5 (65%) и Gemini Omni Flash (55%). Комбинация открытых весов, лицензии до 10 млн долларов ARR и нативной поддержки ComfyUI создаёт канал для проникновения open-weights моделей в продакшн-пайплайны студий и корпораций. Интеграция с ComfyUI ускоряет появление кастомных пайплайнов, LoRA-адаптаций и специализированных продуктов. Скорость 6,8 секунды указывает на сублинейное время генерации и эффективный scheduler, что может стать паттерном для следующего поколения видеомоделей.
Почему это важно для пользователей
Модель можно запустить локально на GPU с 16 ГБ видеопамяти. Организации с выручкой менее 10 млн долларов в год используют LTX-2.5 бесплатно. Пользователи получают один из самых быстрых открытых генераторов видео на рынке — генерацию связанных сцен, эксперименты с физическим AI и робототехникой без отправки данных в облако и без принудительных водяных знаков. Веса доступны на Hugging Face, ComfyUI-ноды уже работают. API-интеграция позволяет встроить генерацию в собственные продукты по цене от $0,09 в секунду.
Что пока неизвестно / ограничения
Точная архитектура нового diffusion-video decoder и параметры кастомной Gemma 4 не раскрыты. Число параметров модели, состав тренировочного набора и методология fine-tuning (включая RLHF pipeline) не опубликованы. Методология слепых тестов, давших 67% win rate, — размер выборки, демографическое разнообразие, статистическая значимость — не disclosed. Точные требования к VRAM для разрешений выше 720p не указаны. Независимые бенчмарки ещё не проведены.
Источники
Автор
Look at AI, редакция
