AI-словарь · Генеративные модели

Генеративные модели

Генеративные модели для изображений: Stable Diffusion, SDXL, FLUX, Midjourney, DALL-E и их внутренние части — VAE, CLIP, латентное пространство. Раздел объясняет, какая модель что умеет, чем они различаются и из каких блоков собран современный image-генератор.

Указатель

  1. 01
    World Models

    World Models (мировые модели) — нейросети, которые не просто рисуют видео, а строят интерактивную симуляцию мира: помнят его состояние и пересчитывают каждый следующий кадр в ответ…

    Продвинутый
  2. 02
    Diffusion Model

    Diffusion Model — архитектура генеративных моделей, которая работает наоборот привычной интуиции: учится «расшумлять» данные. На вход — белый шум, на выходе — фото, видео или звук.…

    Средний
  3. 03
    Refiner

    Refiner — это дополнительная модель в SDXL, которую запускают на последних 20–30% шагов диффузии для финальной полировки. Базовая модель формирует композицию и общую структуру, Refiner подчищает…

    Средний
  4. 04
    Latent Space

    Latent Space (латентное пространство) — это многомерное пространство, в котором нейросеть хранит сжатое представление данных. В Stable Diffusion каждая картинка превращается в латент-вектор размером 64×64×4 —…

    Средний
  5. 05
    CLIP Contrastive Language-Image Pretraining

    CLIP (Contrastive Language-Image Pretraining) — модель OpenAI 2021 года, которая учится одновременно понимать текст и картинки. Внутри две нейросети: image encoder превращает картинку в вектор, text…

    Средний
  6. 06
    VAE Variational Autoencoder

    VAE (Variational Autoencoder) — это пара нейросетей внутри Stable Diffusion, SDXL и FLUX, которая сжимает картинку в компактное представление и раскрывает его обратно. Encoder превращает изображение…

    Средний
  7. 07
    DALL-E

    DALL-E — семейство закрытых моделей генерации изображений от OpenAI, начатое в 2021 году. Третья версия (DALL-E 3) интегрирована в ChatGPT: пользователь пишет запрос на естественном языке,…

    Новичок
  8. 08
    Midjourney

    Midjourney — закрытая коммерческая модель для генерации изображений от одноимённой компании Дэвида Хольца, запущена в 2022 году. Работает только через веб-интерфейс и Discord по подписке от…

    Новичок
  9. 09
    FLUX

    FLUX (FLUX.1) — семейство диффузионных моделей для генерации изображений, выпущенное Black Forest Labs в августе 2024 года. Команда — те же исследователи, что начинали Stable Diffusion.…

    Средний
  10. 10
    SDXL Stable Diffusion XL

    SDXL (Stable Diffusion XL) — увеличенная версия Stable Diffusion от Stability AI, выпущенная в июле 2023 года. По параметрам в три раза больше SD 1.5 —…

    Средний