AI-словарь · Генеративные модели

Генеративные модели

Генеративные модели для изображений: Stable Diffusion, SDXL, FLUX, Midjourney, DALL-E и их внутренние части — VAE, CLIP, латентное пространство. Раздел объясняет, какая модель что умеет, чем они различаются и из каких блоков собран современный image-генератор.

Указатель

  1. 01
    Diffusion Model

    Diffusion Model — семейство генеративных моделей, которые учатся восстанавливать данные из зашумлённого состояния. При генерации процесс идёт от случайного шума к изображению, аудио, видео или другому…

    Средний
  2. 02
    Refiner

    Refiner — отдельная модель или стадия, которая принимает промежуточный результат base и дорабатывает его в позднем диапазоне denoising. Такой этап может уточнять детали, но не является…

    Средний
  3. 03
    Latent Space

    Latent space — внутреннее пространство представлений, с которым работает модель. В latent diffusion изображение обычно кодируется в компактный пространственный тензор, denoiser меняет его за несколько шагов,…

    Средний
  4. 04
    CLIP Contrastive Language-Image Pretraining

    CLIP состоит из текстового и визуального энкодеров, обученных сближать подходящие пары «изображение — подпись» и отдалять неподходящие. Благодаря этому текст и картинку можно сравнивать как векторы.…

    Средний
  5. 05
    VAE Variational Autoencoder

    VAE переводит изображение в компактный латентный тензор и декодирует его обратно в пиксели. В txt2img обычно работает decoder, а в img2img и inpainting нужны обе половины.…

    Средний
  6. 06
    DALL-E

    DALL-E — семейство закрытых моделей генерации изображений OpenAI, начатое в 2021 году. Оно прошло путь от отдельного генератора до связки с диалоговым интерфейсом, а затем уступило…

    Новичок
  7. 07
    Midjourney

    Midjourney создаёт изображения по тексту и визуальным референсам, предлагает варианты и позволяет продолжать выбранный кадр в редакторе. Это облачный сервис по подписке: веса и полный pipeline…

    Новичок
  8. 08
    FLUX

    FLUX — семейство генеративных моделей Black Forest Labs для создания и редактирования изображений. В нём есть облачные и self-hosted варианты, базовые модели и ускоренные версии. Архитектура,…

    Средний
  9. 09
    SDXL Stable Diffusion XL

    SDXL (Stable Diffusion XL) — поколение Stable Diffusion, рассчитанное на изображения примерно мегапиксельного масштаба. Оно использует два текстовых кодировщика, дополнительное условие размера и необязательный refiner. Точные…

    Средний
  10. 10
    Stable Diffusion

    Stable Diffusion — семейство диффузионных моделей изображений, начавшееся с выпуска открытых весов Stability AI. Поколения различаются архитектурой, лицензией и совместимыми LoRA, ControlNet и интерфейсами. Открытые веса…

    Новичок