AI-словарь · Генеративные модели

Генеративные модели

Генеративные модели для изображений: Stable Diffusion, SDXL, FLUX, Midjourney, DALL-E и их внутренние части — VAE, CLIP, латентное пространство. Раздел объясняет, какая модель что умеет, чем они различаются и из каких блоков собран современный image-генератор.

Указатель

  1. 01
    Diffusion Model

    Diffusion Model — семейство генеративных моделей, которые учатся восстанавливать данные из зашумлённого состояния. При генерации процесс идёт от случайного шума к изображению, аудио, видео или другому…

    Средний
  2. 02
    Refiner

    Refiner — отдельная модель или стадия, которая принимает промежуточный результат базовой модели и продолжает генерацию при небольшом уровне шума. Такой этап может уточнять детали, но не…

    Средний
  3. 03
    Latent Space

    Latent space — внутреннее пространство представлений, с которым работает модель. В латентной диффузии изображение представлено компактным пространственным тензором. Модель меняет его за несколько шагов, а декодер…

    Средний
  4. 04
    CLIP Contrastive Language-Image Pretraining

    CLIP состоит из текстового и визуального энкодеров, обученных сближать подходящие пары «изображение — подпись» и отдалять неподходящие. Благодаря этому текст и картинку можно сравнивать как векторы.…

    Средний
  5. 05
    VAE Variational Autoencoder

    VAE переводит изображение в компактный латентный тензор и декодирует его обратно в пиксели. В txt2img обычно работает decoder, а в img2img и inpainting нужны обе половины.…

    Средний
  6. 06
    DALL-E

    DALL-E — семейство генераторов изображений OpenAI, с которым связаны ранние опыты рисования по тексту и редактирования в диалоге. Объясняем, чем поколения отличались друг от друга и…

    Новичок
  7. 07
    Midjourney

    Midjourney создаёт изображения по тексту и визуальным референсам, предлагает варианты и позволяет продолжать выбранный кадр в редакторе. Это облачный сервис: его модель нельзя скачать и запустить…

    Новичок
  8. 08
    FLUX

    FLUX — семейство генеративных моделей Black Forest Labs для создания и редактирования изображений. В нём есть облачные варианты и модели для самостоятельного запуска, базовые модели и…

    Средний
  9. 09
    SDXL Stable Diffusion XL

    SDXL (Stable Diffusion XL) — поколение Stable Diffusion, рассчитанное на изображения примерно мегапиксельного масштаба. Оно использует два текстовых кодировщика, дополнительное условие размера и необязательный refiner. Точные…

    Средний
  10. 10
    Stable Diffusion

    Stable Diffusion — семейство диффузионных моделей изображений, начавшееся с выпуска открытых весов Stability AI. Поколения различаются архитектурой, лицензией и совместимыми LoRA, ControlNet и интерфейсами. Открытые веса…

    Новичок