AI-словарь · Генеративные модели
Генеративные модели
Генеративные модели для изображений: Stable Diffusion, SDXL, FLUX, Midjourney, DALL-E и их внутренние части — VAE, CLIP, латентное пространство. Раздел объясняет, какая модель что умеет, чем они различаются и из каких блоков собран современный image-генератор.
Указатель
-
01
Diffusion Model
Diffusion Model — семейство генеративных моделей, которые учатся восстанавливать данные из зашумлённого состояния. При генерации процесс идёт от случайного шума к изображению, аудио, видео или другому…
-
02
Refiner
Refiner — отдельная модель или стадия, которая принимает промежуточный результат base и дорабатывает его в позднем диапазоне denoising. Такой этап может уточнять детали, но не является…
-
03
Latent Space
Latent space — внутреннее пространство представлений, с которым работает модель. В latent diffusion изображение обычно кодируется в компактный пространственный тензор, denoiser меняет его за несколько шагов,…
-
04
CLIP Contrastive Language-Image Pretraining
CLIP состоит из текстового и визуального энкодеров, обученных сближать подходящие пары «изображение — подпись» и отдалять неподходящие. Благодаря этому текст и картинку можно сравнивать как векторы.…
-
05
VAE Variational Autoencoder
VAE переводит изображение в компактный латентный тензор и декодирует его обратно в пиксели. В txt2img обычно работает decoder, а в img2img и inpainting нужны обе половины.…
-
06
DALL-E
DALL-E — семейство закрытых моделей генерации изображений OpenAI, начатое в 2021 году. Оно прошло путь от отдельного генератора до связки с диалоговым интерфейсом, а затем уступило…
-
07
Midjourney
Midjourney создаёт изображения по тексту и визуальным референсам, предлагает варианты и позволяет продолжать выбранный кадр в редакторе. Это облачный сервис по подписке: веса и полный pipeline…
-
08
FLUX
FLUX — семейство генеративных моделей Black Forest Labs для создания и редактирования изображений. В нём есть облачные и self-hosted варианты, базовые модели и ускоренные версии. Архитектура,…
-
09
SDXL Stable Diffusion XL
SDXL (Stable Diffusion XL) — поколение Stable Diffusion, рассчитанное на изображения примерно мегапиксельного масштаба. Оно использует два текстовых кодировщика, дополнительное условие размера и необязательный refiner. Точные…
-
10
Stable Diffusion
Stable Diffusion — семейство диффузионных моделей изображений, начавшееся с выпуска открытых весов Stability AI. Поколения различаются архитектурой, лицензией и совместимыми LoRA, ControlNet и интерфейсами. Открытые веса…