Stable Diffusion
stable diffusion — открытая диффузионная модель генерации изображений
Stable Diffusion — семейство открытых диффузионных моделей от Stability AI, выпущенное в августе 2022 года. Первая массовая модель, веса которой можно скачать и запустить локально на своей видеокарте. Поколения: SD 1.5 (2022), SDXL (2023), SD 3.5 (2024). Главные преимущества — открытость, бесплатность и возможность тонкой настройки через LoRA или DreamBooth. Лежит в основе ComfyUI, Automatic1111, Forge и почти всей open-source экосистемы генерации.
Коротко
Коротко. Stable Diffusion — открытая диффузионная модель для генерации изображений по тексту. От DALL-E и Midjourney её отличает одна особенность: веса публикуются открыто, и модель можно запустить локально без подписки и интернета. Это и сделало её фундаментом всей open-source экосистемы — от ComfyUI до тысяч LoRA-адаптеров на CivitAI.
Что это такое
Август 2022 года. Stability AI публикует чекпоинт sd-v1-4.ckpt весом 4 ГБ. Через месяц выходит 1.5, и за две недели её скачивают пять миллионов раз. Энтузиасты массово запускают модель на домашних видеокартах — впервые в истории качественная генерация перестаёт быть привилегией закрытых сервисов.
До этого момента картинки делали либо в Midjourney (платный Discord-бот), либо в DALL-E 2 (через очередь OpenAI). Веса спрятаны, цензура жёсткая, на 100 картинок уходит 10 долларов. Stable Diffusion взламывает эту схему одной строчкой лицензии: веса открыты, использование бесплатно, коммерция разрешена.
Поколения модели:
- SD 1.5 (октябрь 2022). 860 миллионов параметров, 512×512 разрешение, до сих пор остаётся стандартом для лёгких задач и старых LoRA. Минимум 6 ГБ VRAM.
- SDXL (июль 2023). 2.6 миллиарда параметров, нативное 1024×1024, заметно лучше композиция и текст. Минимум 8–12 ГБ VRAM. См. отдельную статью.
- SD 3 / 3.5 (2024). Новая архитектура MMDiT, лучше следование промпту, поддержка текста на картинке. SD 3.5 Large — 8.1 миллиарда параметров.
Параллельно сообщество выкатило сотни форков и тюнов: Realistic Vision, DreamShaper, Juggernaut, Pony Diffusion. Каждая — это та же база SD, дотренированная на конкретном датасете.
Как это работает
Диффузия — это «обратное размытие». Сначала модель учится: берёт картинку, постепенно добавляет к ней шум, и запоминает, как этот процесс выглядит. На инференсе она проигрывает запись назад — от чистого шума к чёткой картинке.
Внутри Stable Diffusion четыре связанных компонента:
- VAE — кодирует картинку в латент 64×64 (для SD 1.5) и обратно. Все вычисления идут в этом сжатом пространстве, иначе генерация заняла бы часы.
- U-Net — главная нейросеть. Получает на вход шумный латент и предсказывает, какой шум нужно из него вычесть.
- CLIP — текстовый энкодер. Превращает промпт в эмбеддинг, который подсказывает U-Net, куда вести генерацию.
- Sampler + Scheduler — алгоритм пути от шума к латенту, обычно 20–30 шагов.
Пример на практике
Видеомонтажёру нужна обложка для проекта: рассветный город в стиле киберпанк, 4К, под печать. Бюджет — нулевой.
Запускает ComfyUI на своей RTX 4070 с SDXL Juggernaut XL. Промпт: «cyberpunk city at dawn, neon reflections, cinematic, ultra detailed, 8k». Sampler DPM++ 2M Karras, 28 шагов, CFG 6, разрешение 1024×1536. Через 12 секунд кадр готов.
Не подошёл первый — крутит seed, через 30 итераций отбирает три варианта. Лучший проходит через Upscaler (RealESRGAN ×2) — становится 2048×3072. Полчаса работы, ноль денег, никаких подписок. На облачных сервисах та же серия стоила бы 5–10 долларов и пришла бы с водяным знаком.
Этот сценарий — типичная сила Stable Diffusion: вся пайплайн локальная, повторяемая, без лимитов.
С чем часто путают
- Stable Diffusion и Stability AI — Stability AI это компания, Stable Diffusion это её модель. Компания также выпустила Stable Video Diffusion (видео), Stable Audio (звук) и Stable Cascade (промежуточная архитектура).
- Stable Diffusion и Automatic1111 / ComfyUI — это модель, а Automatic1111 и ComfyUI — интерфейсы для её запуска. Без интерфейса SD это просто файл весов.
- SD 1.5 и SDXL — разные поколения с несовместимыми весами. LoRA для SD 1.5 не работает в SDXL, и наоборот. Промпты тоже ведут себя по-разному.
- Stable Diffusion и FLUX — FLUX (Black Forest Labs, 2024) построен той же командой, что начала Stable Diffusion. Архитектура другая, качество выше, но и веса тяжелее (23 ГБ против 6 ГБ).
Частые ошибки и заблуждения
- «Stable Diffusion полностью бесплатна для всего». Лицензия SD 1.5 и SDXL разрешает коммерческое использование. У SD 3 и 3.5 — Stability AI Community License: бесплатно до 1 миллиона долларов годового дохода, дальше платная коммерческая лицензия.
- «Чем новее версия, тем лучше». Для конкретной задачи может быть не так. SD 1.5 быстрее, легче, под неё больше LoRA. SDXL чище и универсальнее. FLUX качественнее SDXL, но тяжелее и медленнее. Под аниме до сих пор часто берут SD 1.5 + Pony.
- «Stable Diffusion не понимает русский». CLIP, на котором она училась, действительно англоязычный. Промпт на русском работать будет, но хуже. Для надёжности — переводите ключевые слова на английский.
- «Чтобы запустить SD, нужна мощная видеокарта». SD 1.5 запустится даже на 6 ГБ VRAM, а через CPU-режим — на любом ноутбуке (медленно, но работает). Облачные сервисы Replicate и RunPod сдают часы H100 за 1–3 доллара.
Связанные термины
- SDXL — большая версия Stable Diffusion 2023 года, нативное 1024×1024.
- FLUX — конкурент 2024 года от Black Forest Labs, та же команда.
- VAE — кодирует/декодирует латент внутри Stable Diffusion.
- CLIP — текстовый энкодер, превращает промпт в эмбеддинг.
- LoRA — лёгкий адаптер для тонкой настройки SD под стиль или объект.
- ControlNet — модуль для контроля композиции (поза, скетч, глубина).
- ComfyUI — node-based интерфейс, де-факто стандарт для SD в 2026.
- Automatic1111 — классический WebUI для SD, теперь чаще через форк Forge.
Частые вопросы
Какую версию SD выбрать в 2026 году? Под лёгкие задачи и большую коллекцию LoRA — SD 1.5. Под универсальную качественную генерацию — SDXL (с Juggernaut XL или RealVisXL). Под максимум качества и текст на картинке — SD 3.5 Large или FLUX Dev. Многие держат две модели параллельно.
Можно ли использовать Stable Diffusion коммерчески? SD 1.5 и SDXL — да, без ограничений. SD 3 и 3.5 — да, если ваш годовой доход меньше 1 миллиона долларов. Для коммерческих картинок без оглядки на лицензию проще брать SDXL.
Где скачать веса?
Официально — на Hugging Face (stabilityai/stable-diffusion-xl-base-1.0 и варианты). Тюнинги сообщества — CivitAI. Через интерфейс ComfyUI Manager модели подгружаются автоматически.
SD понимает руки и текст? SD 1.5 — почти нет. SDXL — лучше, но всё ещё ломает пальцы и буквы. SD 3.5 и FLUX — научились писать короткий текст на картинке (вывески, лейблы). Для длинных надписей все диффузионные модели до сих пор слабы.
Сколько времени занимает одна картинка? На RTX 4070 SDXL 1024×1024 — 8–15 секунд за 28 шагов. На RTX 3060 — 30–45 секунд. На M2 Mac — около минуты. С ControlNet и адаптерами время растёт в 1.5–2 раза.
Главное
Stable Diffusion — это не одна модель, а целая семья и экосистема. Веса открыты, инфраструктура свободна, тысячи тюнингов и адаптеров доступны бесплатно. Выбирайте версию под задачу: SD 1.5 для лёгкости, SDXL для универсального качества, SD 3.5 для современного следования промпту. Локальный запуск через ComfyUI делает весь рабочий процесс повторяемым — без подписок, лимитов и водяных знаков.