AI-словарь · Генеративные модели
Генеративные модели
Генеративные модели для изображений: Stable Diffusion, SDXL, FLUX, Midjourney, DALL-E и их внутренние части — VAE, CLIP, латентное пространство. Раздел объясняет, какая модель что умеет, чем они различаются и из каких блоков собран современный image-генератор.
Указатель
-
01
Diffusion Model
Diffusion Model — семейство генеративных моделей, которые учатся восстанавливать данные из зашумлённого состояния. При генерации процесс идёт от случайного шума к изображению, аудио, видео или другому…
-
02
Refiner
Refiner — отдельная модель или стадия, которая принимает промежуточный результат базовой модели и продолжает генерацию при небольшом уровне шума. Такой этап может уточнять детали, но не…
-
03
Latent Space
Latent space — внутреннее пространство представлений, с которым работает модель. В латентной диффузии изображение представлено компактным пространственным тензором. Модель меняет его за несколько шагов, а декодер…
-
04
CLIP Contrastive Language-Image Pretraining
CLIP состоит из текстового и визуального энкодеров, обученных сближать подходящие пары «изображение — подпись» и отдалять неподходящие. Благодаря этому текст и картинку можно сравнивать как векторы.…
-
05
VAE Variational Autoencoder
VAE переводит изображение в компактный латентный тензор и декодирует его обратно в пиксели. В txt2img обычно работает decoder, а в img2img и inpainting нужны обе половины.…
-
06
DALL-E
DALL-E — семейство генераторов изображений OpenAI, с которым связаны ранние опыты рисования по тексту и редактирования в диалоге. Объясняем, чем поколения отличались друг от друга и…
-
07
Midjourney
Midjourney создаёт изображения по тексту и визуальным референсам, предлагает варианты и позволяет продолжать выбранный кадр в редакторе. Это облачный сервис: его модель нельзя скачать и запустить…
-
08
FLUX
FLUX — семейство генеративных моделей Black Forest Labs для создания и редактирования изображений. В нём есть облачные варианты и модели для самостоятельного запуска, базовые модели и…
-
09
SDXL Stable Diffusion XL
SDXL (Stable Diffusion XL) — поколение Stable Diffusion, рассчитанное на изображения примерно мегапиксельного масштаба. Оно использует два текстовых кодировщика, дополнительное условие размера и необязательный refiner. Точные…
-
10
Stable Diffusion
Stable Diffusion — семейство диффузионных моделей изображений, начавшееся с выпуска открытых весов Stability AI. Поколения различаются архитектурой, лицензией и совместимыми LoRA, ControlNet и интерфейсами. Открытые веса…