Автор канала «ИИ Маркетинг | Женя Коржавин» показал конвейер, в котором кодинг-агенты Claude Code, Codex и Hermes сами монтируют вертикальные ролики из сырых дублей, снятых на телефон. Вместо таймлайна модель читает транскрипт с таймкодами слов, а рендер остаётся за ffmpeg и headless Chrome. Вся цепочка — video-use, HyperFrames и add-zooms — собирается из открытых компонентов без SaaS-подписок; попробовать можно уже сегодня, но качество склеек нестабильно, и первые ролики автор советует доводить руками.

image
image

Что произошло

Ядро связки — video-use от команды browser-use: репозиторий с 26,3 тыс. звёзд на GitHub и лицензией MIT. LLM при этом не просматривает кадры: она читает транскрипт ElevenLabs Scribe с таймкодами слов, который занимает около 12 КБ текста вместо примерно 45 млн токенов кадров, вырезает паузы и слова-паразиты, выбирает удачные дубли, вжигает субтитры и перед показом самопроверяет каждую склейку через timeline_view. В цепочке работают также HyperFrames от HeyGen, превращающий HTML/CSS/GSAP-анимации в детерминированный MP4 через headless Chrome и ffmpeg (52,6 тыс. звёзд, Apache 2.0, активные коммиты датированы 2026-09-23), и add-zooms от louisedesadeleer, который ставит punch-zoom наезды на акцентные слова по транскрипту OpenAI Whisper через ffmpeg zoompan (11 звёзд). Отдельно в посте упомянут свежий Hypit: 15,1 тыс. звёзд на GitHub и релиз v0.2.13.

Контекст

Ключ к пониманию связки — смена представления данных. В разговорном формате «говорящей головы» смысл видео почти целиком закодирован в речи, поэтому транскрипт с таймкодами слов служит дешёвым текстовым прокси вместо покадрового просмотра: задача монтажа сжимается на порядки, и именно это делает агентный монтаж осуществимым на сегодняшних моделях. У приёма есть оборотная сторона: агент не видит визуальный состав кадра и судит о материале только по речи, поэтому визуальные промахи монтажа способен заметить только человек. Архитектурно интересен и сам паттерн пайплайна, в котором недетерминированные решения принимает языковая модель, а рендер и контроль результата вынесены в предсказуемый слой. Звёзды на GitHub при этом измеряют интерес сообщества, а не качество монтажа, и в подаче подобных связок создают ложное ощущение зрелости каждого звена.

Почему это важно для индустрии

Для отрасли монтаж разговорного видео превращается в конвейер поверх кодинг-агентов, и это меняет экономику постпродакшна: себестоимость сборки вертикального ролика падает до уровня часов настройки плюс API-платежей, потому что цепочка video-use, HyperFrames и add-zooms собирается из открытых скиллов без SaaS-подписок. Не менее важен переносимый каркас: схема, в которой модель принимает монтажные решения, рендер выполняется детерминированно, а каждая склейка проходит самопроверку, годится для агентных пайплайнов и за пределами монтажа. Hypit работает отдельно: он шаблонизирует чужие ролики, перенося структуру, субтитры, эффекты и B-roll на новый материал, что удешевляет массовое производство однотипного контента; автор прямо называет такой режим «раем для нейрослоперов» и не советует им пользоваться. Для стартапов это commoditization постпродакшна.

Почему это важно для пользователей

Попробовать конвейер можно уже сегодня: клонировать video-use, поставить ffmpeg, вставить API-ключ ElevenLabs и скидывать дубли в папку, а add-zooms подключается как скилл Claude Code командой ./install.sh. Практическая ценность — черновая сборка разговорных роликов с последующей ручной доводкой: решения о склейках агент принимает сам, качество нестабильно, поэтому первые ролики разумнее монтировать руками. Отдельная осторожность нужна с Hypit: это фабрика клонов чужих роликов, а не инструмент для выработки собственного стиля.

Что пока неизвестно / ограничения

Заявления о первенстве ничем не подтверждены: формулировка «впервые собирается как код» в источниках не подкреплена, бенчмарков, подтверждающих capability-заявления связки, нет — это инженерная композиция известных приёмов вроде транскрипта-прокси, детерминированного рендера и self-check, а не новая модель. По заявленным признакам это демонстрация, а не production-система. Цифра $1,15 за клон 20-секундного ролика — единственная демо-точка из релиза v0.2.13 Hypit, а не измерение: стоимость на длинных роликах и другом материале неизвестна, как и скорость работы и расход на минуту видео. Стабильность качества склеек описана только авторской оценкой, а не метрикой, и открытым остаётся вопрос, выдержит ли конвейер материалы сложнее разговорного формата.

Источники

Автор

Look at AI, редакция