Stable Diffusion

stable diffusion — открытая диффузионная модель генерации изображений

Раздел
Генеративные модели
Обновлено
19.06.26

Stable Diffusion — семейство открытых диффузионных моделей от Stability AI, выпущенное в августе 2022 года. Первая массовая модель, веса которой можно скачать и запустить локально на своей видеокарте. Поколения: SD 1.5 (2022), SDXL (2023), SD 3.5 (2024). Главные преимущества — открытость, бесплатность и возможность тонкой настройки через LoRA или DreamBooth. Лежит в основе ComfyUI, Automatic1111, Forge и почти всей open-source экосистемы генерации.

Коротко

Коротко. Stable Diffusion — открытая диффузионная модель для генерации изображений по тексту. От DALL-E и Midjourney её отличает одна особенность: веса публикуются открыто, и модель можно запустить локально без подписки и интернета. Это и сделало её фундаментом всей open-source экосистемы — от ComfyUI до тысяч LoRA-адаптеров на CivitAI.

Что это такое

Август 2022 года. Stability AI публикует чекпоинт sd-v1-4.ckpt весом 4 ГБ. Через месяц выходит 1.5, и за две недели её скачивают пять миллионов раз. Энтузиасты массово запускают модель на домашних видеокартах — впервые в истории качественная генерация перестаёт быть привилегией закрытых сервисов.

До этого момента картинки делали либо в Midjourney (платный Discord-бот), либо в DALL-E 2 (через очередь OpenAI). Веса спрятаны, цензура жёсткая, на 100 картинок уходит 10 долларов. Stable Diffusion взламывает эту схему одной строчкой лицензии: веса открыты, использование бесплатно, коммерция разрешена.

Поколения модели:

  • SD 1.5 (октябрь 2022). 860 миллионов параметров, 512×512 разрешение, до сих пор остаётся стандартом для лёгких задач и старых LoRA. Минимум 6 ГБ VRAM.
  • SDXL (июль 2023). 2.6 миллиарда параметров, нативное 1024×1024, заметно лучше композиция и текст. Минимум 8–12 ГБ VRAM. См. отдельную статью.
  • SD 3 / 3.5 (2024). Новая архитектура MMDiT, лучше следование промпту, поддержка текста на картинке. SD 3.5 Large — 8.1 миллиарда параметров.

Параллельно сообщество выкатило сотни форков и тюнов: Realistic Vision, DreamShaper, Juggernaut, Pony Diffusion. Каждая — это та же база SD, дотренированная на конкретном датасете.

Как это работает

Диффузия — это «обратное размытие». Сначала модель учится: берёт картинку, постепенно добавляет к ней шум, и запоминает, как этот процесс выглядит. На инференсе она проигрывает запись назад — от чистого шума к чёткой картинке.

Внутри Stable Diffusion четыре связанных компонента:

  1. VAE — кодирует картинку в латент 64×64 (для SD 1.5) и обратно. Все вычисления идут в этом сжатом пространстве, иначе генерация заняла бы часы.
  2. U-Net — главная нейросеть. Получает на вход шумный латент и предсказывает, какой шум нужно из него вычесть.
  3. CLIP — текстовый энкодер. Превращает промпт в эмбеддинг, который подсказывает U-Net, куда вести генерацию.
  4. Sampler + Scheduler — алгоритм пути от шума к латенту, обычно 20–30 шагов.

Пример на практике

Видеомонтажёру нужна обложка для проекта: рассветный город в стиле киберпанк, 4К, под печать. Бюджет — нулевой.

Запускает ComfyUI на своей RTX 4070 с SDXL Juggernaut XL. Промпт: «cyberpunk city at dawn, neon reflections, cinematic, ultra detailed, 8k». Sampler DPM++ 2M Karras, 28 шагов, CFG 6, разрешение 1024×1536. Через 12 секунд кадр готов.

Не подошёл первый — крутит seed, через 30 итераций отбирает три варианта. Лучший проходит через Upscaler (RealESRGAN ×2) — становится 2048×3072. Полчаса работы, ноль денег, никаких подписок. На облачных сервисах та же серия стоила бы 5–10 долларов и пришла бы с водяным знаком.

Этот сценарий — типичная сила Stable Diffusion: вся пайплайн локальная, повторяемая, без лимитов.

С чем часто путают

  • Stable Diffusion и Stability AI — Stability AI это компания, Stable Diffusion это её модель. Компания также выпустила Stable Video Diffusion (видео), Stable Audio (звук) и Stable Cascade (промежуточная архитектура).
  • Stable Diffusion и Automatic1111 / ComfyUI — это модель, а Automatic1111 и ComfyUI — интерфейсы для её запуска. Без интерфейса SD это просто файл весов.
  • SD 1.5 и SDXL — разные поколения с несовместимыми весами. LoRA для SD 1.5 не работает в SDXL, и наоборот. Промпты тоже ведут себя по-разному.
  • Stable Diffusion и FLUX — FLUX (Black Forest Labs, 2024) построен той же командой, что начала Stable Diffusion. Архитектура другая, качество выше, но и веса тяжелее (23 ГБ против 6 ГБ).

Частые ошибки и заблуждения

  • «Stable Diffusion полностью бесплатна для всего». Лицензия SD 1.5 и SDXL разрешает коммерческое использование. У SD 3 и 3.5 — Stability AI Community License: бесплатно до 1 миллиона долларов годового дохода, дальше платная коммерческая лицензия.
  • «Чем новее версия, тем лучше». Для конкретной задачи может быть не так. SD 1.5 быстрее, легче, под неё больше LoRA. SDXL чище и универсальнее. FLUX качественнее SDXL, но тяжелее и медленнее. Под аниме до сих пор часто берут SD 1.5 + Pony.
  • «Stable Diffusion не понимает русский». CLIP, на котором она училась, действительно англоязычный. Промпт на русском работать будет, но хуже. Для надёжности — переводите ключевые слова на английский.
  • «Чтобы запустить SD, нужна мощная видеокарта». SD 1.5 запустится даже на 6 ГБ VRAM, а через CPU-режим — на любом ноутбуке (медленно, но работает). Облачные сервисы Replicate и RunPod сдают часы H100 за 1–3 доллара.

Связанные термины

  • SDXL — большая версия Stable Diffusion 2023 года, нативное 1024×1024.
  • FLUX — конкурент 2024 года от Black Forest Labs, та же команда.
  • VAE — кодирует/декодирует латент внутри Stable Diffusion.
  • CLIP — текстовый энкодер, превращает промпт в эмбеддинг.
  • LoRA — лёгкий адаптер для тонкой настройки SD под стиль или объект.
  • ControlNet — модуль для контроля композиции (поза, скетч, глубина).
  • ComfyUI — node-based интерфейс, де-факто стандарт для SD в 2026.
  • Automatic1111 — классический WebUI для SD, теперь чаще через форк Forge.

Частые вопросы

Какую версию SD выбрать в 2026 году? Под лёгкие задачи и большую коллекцию LoRA — SD 1.5. Под универсальную качественную генерацию — SDXL (с Juggernaut XL или RealVisXL). Под максимум качества и текст на картинке — SD 3.5 Large или FLUX Dev. Многие держат две модели параллельно.

Можно ли использовать Stable Diffusion коммерчески? SD 1.5 и SDXL — да, без ограничений. SD 3 и 3.5 — да, если ваш годовой доход меньше 1 миллиона долларов. Для коммерческих картинок без оглядки на лицензию проще брать SDXL.

Где скачать веса? Официально — на Hugging Face (stabilityai/stable-diffusion-xl-base-1.0 и варианты). Тюнинги сообщества — CivitAI. Через интерфейс ComfyUI Manager модели подгружаются автоматически.

SD понимает руки и текст? SD 1.5 — почти нет. SDXL — лучше, но всё ещё ломает пальцы и буквы. SD 3.5 и FLUX — научились писать короткий текст на картинке (вывески, лейблы). Для длинных надписей все диффузионные модели до сих пор слабы.

Сколько времени занимает одна картинка? На RTX 4070 SDXL 1024×1024 — 8–15 секунд за 28 шагов. На RTX 3060 — 30–45 секунд. На M2 Mac — около минуты. С ControlNet и адаптерами время растёт в 1.5–2 раза.

Главное

Stable Diffusion — это не одна модель, а целая семья и экосистема. Веса открыты, инфраструктура свободна, тысячи тюнингов и адаптеров доступны бесплатно. Выбирайте версию под задачу: SD 1.5 для лёгкости, SDXL для универсального качества, SD 3.5 для современного следования промпту. Локальный запуск через ComfyUI делает весь рабочий процесс повторяемым — без подписок, лимитов и водяных знаков.