AI-словарь · Генеративные модели
Генеративные модели
Генеративные модели для изображений: Stable Diffusion, SDXL, FLUX, Midjourney, DALL-E и их внутренние части — VAE, CLIP, латентное пространство. Раздел объясняет, какая модель что умеет, чем они различаются и из каких блоков собран современный image-генератор.
Указатель
-
01
World Models
World Models (мировые модели) — нейросети, которые не просто рисуют видео, а строят интерактивную симуляцию мира: помнят его состояние и пересчитывают каждый следующий кадр в ответ…
-
02
Diffusion Model
Diffusion Model — архитектура генеративных моделей, которая работает наоборот привычной интуиции: учится «расшумлять» данные. На вход — белый шум, на выходе — фото, видео или звук.…
-
03
Refiner
Refiner — это дополнительная модель в SDXL, которую запускают на последних 20–30% шагов диффузии для финальной полировки. Базовая модель формирует композицию и общую структуру, Refiner подчищает…
-
04
Latent Space
Latent Space (латентное пространство) — это многомерное пространство, в котором нейросеть хранит сжатое представление данных. В Stable Diffusion каждая картинка превращается в латент-вектор размером 64×64×4 —…
-
05
CLIP Contrastive Language-Image Pretraining
CLIP (Contrastive Language-Image Pretraining) — модель OpenAI 2021 года, которая учится одновременно понимать текст и картинки. Внутри две нейросети: image encoder превращает картинку в вектор, text…
-
06
VAE Variational Autoencoder
VAE (Variational Autoencoder) — это пара нейросетей внутри Stable Diffusion, SDXL и FLUX, которая сжимает картинку в компактное представление и раскрывает его обратно. Encoder превращает изображение…
-
07
DALL-E
DALL-E — семейство закрытых моделей генерации изображений от OpenAI, начатое в 2021 году. Третья версия (DALL-E 3) интегрирована в ChatGPT: пользователь пишет запрос на естественном языке,…
-
08
Midjourney
Midjourney — закрытая коммерческая модель для генерации изображений от одноимённой компании Дэвида Хольца, запущена в 2022 году. Работает только через веб-интерфейс и Discord по подписке от…
-
09
FLUX
FLUX (FLUX.1) — семейство диффузионных моделей для генерации изображений, выпущенное Black Forest Labs в августе 2024 года. Команда — те же исследователи, что начинали Stable Diffusion.…
-
10
SDXL Stable Diffusion XL
SDXL (Stable Diffusion XL) — увеличенная версия Stable Diffusion от Stability AI, выпущенная в июле 2023 года. По параметрам в три раза больше SD 1.5 —…