Text-to-Video

text-to-video — генерация видео по текстовому промпту

Раздел
Видео
Обновлено
11.08.26

Text-to-Video — генерация видео по текстовому описанию. Есть облачные сервисы и открытые модели для локального запуска, в том числе через ComfyUI. Они различаются длиной клипа, разрешением, управлением камерой, звуком и правами на результат, поэтому сравнение лучше проводить на одной и той же сцене.

Коротко

Коротко. Text-to-Video создаёт последовательность кадров по описанию сцены и движения. В отличие от генерации картинки, модель должна удерживать объекты во времени, поэтому хороший prompt описывает не только внешний вид, но и действие, камеру, темп и неизменные детали.

Что это такое

Публичные демонстрации Sora в 2024 году стали заметной исторической точкой: длинный связный план впервые увидела широкая аудитория. Но демонстрация и доступный производственный режим — разные вещи. Длительность, размер, звук и управление зависят от конкретной модели и меняются вместе с сервисом.

Главные сценарии применения:

  • Маркетинг: короткие промо-ролики, ads.
  • Кино: previz, storyboards, B-roll.
  • Социальные сети: TikTok, Reels, Shorts.
  • Образование: анимированные объяснения сложных тем.
  • Игры: концепт-сцены, кат-сцены.

Как это работает

Под капотом — диффузионная модель, как Stable Diffusion, но для видео. Главные отличия:

  1. 3D-латент. Вместо 2D (W×H×C) — 4D (W×H×T×C), где T — время.
  2. Spatio-temporal attention. Внимание не только между пикселями кадра, но и между кадрами во времени.
  3. Больший вычислительный объём. Временная ось добавляет данные и связи между кадрами.
  4. Видео с описаниями. Для обучения нужны не только кадры, но и сведения о движении, сцене и камере; точный состав закрытых датасетов обычно неизвестен.

Pipeline генерации:

  1. Текст превращается в условия через один или несколько текстовых энкодеров.
  2. Генератор строит временной latent или другую внутреннюю последовательность.
  3. Декодер раскрывает её в кадры.
  4. Дополнительные этапы могут отвечать за размер, интерполяцию, звук или монтаж.

Локальная скорость зависит от числа кадров, размера, точности весов, offload и видеокарты. Один и тот же ярлык модели может скрывать варианты с заметно разными требованиями.

Пример на практике

Видеомонтажёр делает рекламный ролик для бренда часов: несколько коротких планов на разных фонах.

Без Text-to-Video:

  • Обычная съёмка требует команды, реквизита, локации и времени на монтаж.

Промпт 1:

Close-up shot of a man's hand wearing a luxury silver watch, 
natural light, modern office desk in soft focus background, 
8 seconds, cinematic, slight camera movement

После генерации он проверяет форму часов, число пальцев, отражения, направление движения и то, не меняется ли логотип между кадрами.

Повторяет с промптами для других сцен:

  • «…mountain landscape in background»
  • «…restaurant table, candle light»
  • «…city street at sunset»

Несколько коротких клипов собираются в ролик в DaVinci Resolve. Итоговые время и стоимость зависят от числа итераций, тарифа, разрешения и объёма ручного монтажа.

В ComfyUI открытые видеомодели подключаются через core- или custom nodes. Точный граф задаёт карточка модели: загрузчик, текстовые условия, sampler, VAE и сохранение видео могут различаться. Встроенный Manager помогает найти пакеты, но совместимость workflow всё равно проверяется по версиям.

С чем часто путают

  • Text-to-Video и Image-to-Video — T2V начинает с нуля по тексту. I2V берёт картинку и оживляет.
  • Text-to-Video и Image-to-Image-to-Video — двухступенчатый pipeline: сначала картинка из текста, потом видео из картинки. Иногда даёт лучше результат.
  • Закрытые видеомодели разных компаний — могут выглядеть похоже в интерфейсе, но различаются управлением, данными, звуком, API и условиями использования.
  • T2V и AnimateDiff — AnimateDiff добавляет движение к совместимой image-модели, а отдельная T2V-модель обучается как видеогенератор. Граница в продуктовых workflow может быть скрыта.
  • T2V и Lip Sync — Lip Sync это синхронизация губ с речью на готовом видео. T2V — генерация видео с нуля.

Частые ошибки и заблуждения

  • «Одна видеомодель заменяет всё производство». Нет. Сценарий, права на исходники, continuity, монтаж, звук и финальный контроль остаются отдельными задачами.
  • «Видео генерируется так же легко, как картинка». Видео обычно требует больше вычислений и итераций: нужно согласовать движение, длительность и последовательность кадров.
  • «Все модели одинаковые». Они различаются управлением камерой, работой с референсами, звуком, длительностью и доступными инструментами монтажа. Сравнивать их лучше на одной и той же сцене.
  • «Локальная генерация бесплатная и быстрая». У неё нет платы за каждый API-вызов, но есть оборудование, электричество, хранение весов и время настройки. Скорость измеряют на точном workflow.
  • «Видео-модели понимают физику». Лучше, чем картиночные, но не до конца. Жидкости, ткань, толпы — всё ещё проблема.

Связанные термины

  • Закрытые видеосервисы — готовая инфраструктура с меняющимися моделями, тарифами и правилами.
  • Открытые видеомодели — локальный или собственный облачный запуск в пределах лицензии точных весов.
  • Image-to-Video — родственная техника.
  • AnimateDiff — plugin для SD-моделей.
  • Diffusion — общая архитектура.

Частые вопросы

Облако или локальный запуск? Облако проще начать использовать и не требует своей видеокарты. Открытые веса дают контроль над файлами и окружением, но требуют совместимого оборудования, настройки и проверки лицензии.

Какая длительность доступна? Зависит от модели и режима. Предельная длина менее важна, чем участок, на котором сохраняются персонаж, предметы и движение; длинную сцену часто собирают из отдельных планов.

Можно ли генерировать в 4K? Некоторые сервисы предлагают крупный выход, другие используют апскейл после генерации. Для финала важны не только пиксели, но и временная стабильность мелких деталей: обычный апскейлер не исправит меняющийся логотип или лицо.

Как добавить звук? Либо выбрать модель со звуком, либо собрать дорожку отдельно: речь, эффекты, музыка и сведение. Отдельный маршрут даёт больше контроля, но требует синхронизации и прав на каждый источник.

Через API стоимость обычно зависит от длительности, разрешения, модели и числа генераций. Точные ставки публикует провайдер.

Локально вообще возможно? Да. Открытые модели выпускаются в разных размерах и точностях. Требования считают по конкретным весам, числу кадров и разрешению; при нехватке памяти помогают quantization и offload, но увеличивают время или меняют качество.

Главное

Text-to-Video превращает описание сцены и движения в последовательность кадров. Видеомодель должна удерживать объекты во времени, поэтому результат оценивают по всему плану: continuity, камере, физике, надписям и монтажному шву. Облачные сервисы снимают настройку инфраструктуры, открытые веса дают больше контроля. В обоих случаях хороший ролик обычно складывается из коротких проверенных планов, отбора дублей, звука и обычного монтажа.