Stable Diffusion

stable diffusion — открытая диффузионная модель генерации изображений

Раздел
Генеративные модели
Обновлено
11.08.26

Stable Diffusion — семейство диффузионных моделей изображений, начавшееся с выпуска открытых весов Stability AI. Поколения различаются архитектурой, лицензией и совместимыми LoRA, ControlNet и интерфейсами. Открытые веса дают локальный запуск и тонкую настройку при подходящем оборудовании, но не означают одинаковых условий использования для каждой модели.

Коротко

Коротко. Stable Diffusion — открытая диффузионная модель для генерации изображений по тексту. От DALL-E и Midjourney её отличает одна особенность: веса публикуются открыто, и модель можно запустить локально без подписки и интернета. Это и сделало её фундаментом всей open-source экосистемы — от ComfyUI до тысяч LoRA-адаптеров на CivitAI.

Что это такое

В 2022 году публикация ранних весов Stable Diffusion сделала качественную генерацию изображений доступной для локальных экспериментов. Вокруг моделей быстро выросли интерфейсы, расширения и сообщество авторов собственных checkpoint.

До появления открытых весов большинство заметных генераторов изображений работали как закрытые сервисы. Stable Diffusion предложила другой маршрут: модель можно было скачать, изучать и запускать на своей машине в пределах лицензии конкретного релиза. Это дало экосистеме локальные интерфейсы, дообучения и независимые исследовательские проекты.

Поколения модели:

  • SD 1.x. Лёгкое поколение с большой коллекцией старых checkpoints, LoRA и расширений; обычно работает с меньшим разрешением и скромнее расходует память.
  • SDXL. Более крупная архитектура, рассчитанная на больший базовый размер кадра и собственную экосистему совместимых дополнений. См. отдельную статью.
  • SD 3.x. Ветка с MMDiT и другими текстовыми энкодерами. Требования, лицензия и совместимость зависят от точного релиза, поэтому название семейства здесь недостаточно.

Параллельно сообщество выкатило сотни форков и тюнов: Realistic Vision, DreamShaper, Juggernaut, Pony Diffusion. Каждая — это та же база SD, дотренированная на конкретном датасете.

Как это работает

Диффузия — это «обратное размытие». Сначала модель учится: берёт картинку, постепенно добавляет к ней шум, и запоминает, как этот процесс выглядит. На инференсе она проигрывает запись назад — от чистого шума к чёткой картинке.

Внутри Stable Diffusion четыре связанных компонента:

  1. VAE — кодирует картинку в компактное латентное представление и декодирует результат обратно. Размер латента зависит от архитектуры; работа в нём заметно снижает вычислительную нагрузку по сравнению с обработкой исходных пикселей на каждом шаге.
  2. U-Net — главная нейросеть. Получает на вход шумный латент и предсказывает, какой шум нужно из него вычесть.
  3. CLIP — текстовый энкодер. Превращает промпт в эмбеддинг, который подсказывает U-Net, куда вести генерацию.
  4. Sampler + Scheduler — численный маршрут от шума к латенту. Подходящее число шагов зависит от checkpoint, способа обучения и выбранного метода.

Пример на практике

Видеомонтажёру нужна обложка для проекта: рассветный город в стиле киберпанк, 4К, под печать. Бюджет — нулевой.

Запускает ComfyUI с совместимым SDXL-checkpoint и собирает базовый граф: prompt, latent нужной формы, sampler и VAE Decode. Сначала проверяет композицию на нескольких seed, затем отдельно делает inpainting и upscale. Время зависит от checkpoint, размера, шагов, precision и оборудования.

Не подошёл первый вариант — меняется seed, после серии проб остаются три кандидата. Выбранный кадр проходит через апскейлер и ручную проверку деталей. Локальный запуск не берёт плату за каждый запрос, но использует собственное оборудование, электричество и время; облачный переносит эти расходы в тариф сервиса.

Этот сценарий — типичная сила Stable Diffusion: вся пайплайн локальная, повторяемая, без лимитов.

С чем часто путают

  • Stable Diffusion и Stability AI — Stability AI это компания, Stable Diffusion это её модель. Компания также выпустила Stable Video Diffusion (видео), Stable Audio (звук) и Stable Cascade (промежуточная архитектура).
  • Stable Diffusion и Automatic1111 / ComfyUI — это модель, а Automatic1111 и ComfyUI — интерфейсы для её запуска. Без интерфейса SD это просто файл весов.
  • SD 1.5 и SDXL — разные поколения с несовместимыми весами. LoRA для SD 1.5 не работает в SDXL, и наоборот. Промпты тоже ведут себя по-разному.
  • Stable Diffusion и FLUX — это разные семейства моделей с разной архитектурой, лицензиями и экосистемами дополнений. Качество и требования корректнее сравнивать на конкретных версиях и задачах.

Частые ошибки и заблуждения

  • «Stable Diffusion полностью бесплатна для всего». У разных поколений, checkpoints и производных моделей могут быть разные лицензии. Возможность коммерческого применения проверяют по карточке точных весов и действующим условиям сервиса, а не по названию семейства.
  • «Чем новее версия, тем лучше». Более новая архитектура может точнее понимать инструкцию, но требовать больше памяти или не поддерживать привычные LoRA и ControlNet. Полезнее сравнить кандидатов на одинаковых сценах и в том workflow, который нужен проекту.
  • «Stable Diffusion не понимает русский». CLIP, на котором она училась, действительно англоязычный. Промпт на русском работать будет, но хуже. Для надёжности — переводите ключевые слова на английский.
  • «Чтобы запустить SD, обязательно нужна флагманская видеокарта». Нет. Лёгкие или квантизованные варианты работают на более скромном оборудовании, а крупные можно запускать с offload либо в облаке. Практический предел зависит от точного checkpoint, размера кадра и терпимой задержки.

Связанные термины

  • SDXL — большая версия Stable Diffusion 2023 года, нативное 1024×1024.
  • FLUX — другое семейство генеративных моделей Black Forest Labs со своей архитектурой, лицензиями и экосистемой.
  • VAE — кодирует/декодирует латент внутри Stable Diffusion.
  • CLIP — текстовый энкодер, превращает промпт в эмбеддинг.
  • LoRA — лёгкий адаптер для тонкой настройки SD под стиль или объект.
  • ControlNet — модуль для контроля композиции (поза, скетч, глубина).
  • WebUI-интерфейсы — форма с вкладками и параметрами; поддержка конкретной архитектуры зависит от проекта и версии.

Частые вопросы

Какую версию SD выбрать на практике? Сначала смотрят на совместимость существующих LoRA и ControlNet, доступную память, лицензию и тип изображений. Старые ветки удобны богатой экосистемой и меньшим весом, новые могут лучше следовать сложной инструкции, но требуют другого workflow. Небольшой тестовый набор своих сцен полезнее универсального рейтинга.

Можно ли использовать Stable Diffusion коммерчески? Коммерческие права задаёт лицензия точного файла весов и могут различаться даже внутри одного семейства. Перед публикацией или передачей модели клиенту стоит открыть карточку нужного checkpoint и прочитать действующую лицензию; старое описание другого поколения её не заменяет.

Где скачать веса? Официальные веса и карточки моделей публикуются в репозиториях авторов, часто на Hugging Face. Дообучения сообщества встречаются на специализированных площадках. Встроенный ComfyUI Manager умеет работать с загрузкой моделей из поддерживаемых источников, но перед скачиванием всё равно важны происхождение файла, лицензия и контрольная сумма.

SD понимает руки и текст? Способность рисовать руки и надписи заметно различается между checkpoints и режимами генерации. Даже сильная модель может исказить длинный текст или мелкую анатомию, поэтому важные надписи обычно проверяют отдельно и при необходимости доводят редактированием или вторым проходом.

Сколько времени занимает одна картинка? Скорость измеряют на точном workflow после прогрева. На неё влияют размер кадра, sampler, число вызовов denoiser, precision, backend, VAE, ControlNet и другие адаптеры. Сравнение по одному названию видеокарты без этих условий мало что говорит.

Главное

Stable Diffusion — не одна модель, а семейство моделей и инструментов вокруг них. Поколения различаются архитектурой, требованиями к памяти, лицензиями и совместимыми дополнениями. ComfyUI помогает сохранить процесс в виде графа и повторить генерацию с теми же настройками.