AI-словарь · Видео

Видео

AI-видео — создание и обработка движущегося изображения нейросетями: генерация ролика из текста (text-to-video), оживление картинки (image-to-video), липсинк, клонирование голоса. Раздел собирает инструменты и понятия, на которых держится производство видео без камеры.

Указатель

  1. 01
    AnimateDiff

    AnimateDiff — способ заставить обычную модель Stable Diffusion рисовать не один кадр, а короткое видео. К модели подключается отдельный «модуль движения» (motion module), обученный на видео:…

    Средний
  2. 02
    ElevenLabs

    ElevenLabs — облачная платформа для работы с AI-аудио. Она превращает текст в речь, создаёт и клонирует голоса, переводит аудио и видео, распознаёт речь и помогает собирать…

    Средний
  3. 03
    Music Generation

    Музыкальные модели создают аудио по описанию, напеву, референсу или заданной структуре. Одни генерируют готовую песню с вокалом, другие — инструментал, отдельные партии или продолжение фрагмента. Практический…

    Средний
  4. 04
    Whisper

    Whisper — семейство моделей OpenAI для многоязычного распознавания речи и перевода аудио в английский. Веса опубликованы для локального запуска, а производные реализации ускоряют инференс и добавляют…

    Средний
  5. 05
    TTS и STT

    STT превращает запись речи в текст, а TTS — текст в звучащую речь. Вместе они лежат в основе транскрипции, дубляжа и голосовых интерфейсов. Качество зависит не…

    Средний
  6. 06
    Voice Cloning

    Voice Cloning переносит тембр, акцент и манеру речи из образцов на новый текст. Быстрый клон строится по короткой записи, профессиональный использует больше чистого материала и верификацию.…

    Средний
  7. 07
    Lip Sync

    Lip Sync меняет движение губ в видео так, чтобы оно совпадало с новой речью. Техника помогает при дубляже, замене реплик и создании говорящих аватаров. Естественный результат…

    Средний
  8. 08
    Runway, Kling, Pika

    Runway, Kling и Pika — закрытые платформы генерации и редактирования видео. Их модели и тарифы меняются, поэтому устойчивое сравнение строится вокруг референсов, управления камерой, сохранения персонажа,…

    Средний
  9. 09
    Image-to-Video

    Image-to-Video (I2V) — модель берёт статичную картинку и достраивает движение объектов, камеры и света во времени. Исходник задаёт внешний вид сцены, а prompt уточняет, что должно…

    Средний
  10. 10
    Text-to-Video

    Text-to-Video — генерация видео по текстовому описанию. Есть облачные сервисы и открытые модели для локального запуска, в том числе через ComfyUI. Они различаются длиной клипа, разрешением,…

    Средний