AI-словарь · Видео
Видео
AI-видео — создание и обработка движущегося изображения нейросетями: генерация ролика из текста (text-to-video), оживление картинки (image-to-video), липсинк, клонирование голоса. Раздел собирает инструменты и понятия, на которых держится производство видео без камеры.
Указатель
-
01
AnimateDiff
AnimateDiff — способ заставить обычную модель Stable Diffusion рисовать не один кадр, а короткое видео. К модели подключается отдельный «модуль движения» (motion module), обученный на видео:…
-
02
ElevenLabs
ElevenLabs — облачная платформа для работы с AI-аудио. Она превращает текст в речь, создаёт и клонирует голоса, переводит аудио и видео, распознаёт речь и помогает собирать…
-
03
Music Generation
Музыкальные модели создают аудио по описанию, напеву, референсу или заданной структуре. Одни генерируют готовую песню с вокалом, другие — инструментал, отдельные партии или продолжение фрагмента. Практический…
-
04
Whisper
Whisper — семейство моделей OpenAI для многоязычного распознавания речи и перевода аудио в английский. Веса опубликованы для локального запуска, а производные реализации ускоряют инференс и добавляют…
-
05
TTS и STT
STT превращает запись речи в текст, а TTS — текст в звучащую речь. Вместе они лежат в основе транскрипции, дубляжа и голосовых интерфейсов. Качество зависит не…
-
06
Voice Cloning
Voice Cloning переносит тембр, акцент и манеру речи из образцов на новый текст. Быстрый клон строится по короткой записи, профессиональный использует больше чистого материала и верификацию.…
-
07
Lip Sync
Lip Sync меняет движение губ в видео так, чтобы оно совпадало с новой речью. Техника помогает при дубляже, замене реплик и создании говорящих аватаров. Естественный результат…
-
08
Runway, Kling, Pika
Runway, Kling и Pika — закрытые платформы генерации и редактирования видео. Их модели и тарифы меняются, поэтому устойчивое сравнение строится вокруг референсов, управления камерой, сохранения персонажа,…
-
09
Image-to-Video
Image-to-Video (I2V) — модель берёт статичную картинку и достраивает движение объектов, камеры и света во времени. Исходник задаёт внешний вид сцены, а prompt уточняет, что должно…
-
10
Text-to-Video
Text-to-Video — генерация видео по текстовому описанию. Есть облачные сервисы и открытые модели для локального запуска, в том числе через ComfyUI. Они различаются длиной клипа, разрешением,…