Большой разбор

Stable Diffusion: полный гид по генерации изображений и видео

Stable Diffusion — семейство генеративных моделей и большая экосистема локальных инструментов. Модели можно запускать через ComfyUI и другие интерфейсы, дополнять совместимыми LoRA, ControlNet и референсами. В гиде разберём устройство диффузии, различия архитектур и способ собрать повторяемый процесс без универсальных «лучших настроек».

Чтение
32 мин
Уровень
Средний
Обновлено
11.08.26

Stable Diffusion без культа версий

Публикация ранних весов Stable Diffusion в 2022 году сделала локальную генерацию изображений доступной широкой аудитории. Вокруг моделей появились интерфейсы, адаптеры, способы структурного контроля и тысячи пользовательских workflow.

С тех пор название стало неоднозначным. Им называют исходные модели Stability AI, совместимые дообучения, весь локальный стек генерации и иногда даже соседние архитектуры. Для практической работы полезнее разделять четыре вещи:

  • базовую архитектуру и конкретные веса;
  • лицензию модели и дополнений;
  • интерфейс, в котором собран процесс;
  • workflow со всеми загрузчиками, энкодерами и параметрами.

Этот гид объясняет, как эти части связаны и почему файл с похожим расширением не обязательно подходит к другому поколению модели.

Четыре фотолистка показывают, как Stable Diffusion по текстовому условию постепенно превращает шум в ясное изображение чёрного кота у окна.
Диффузионный pipeline начинает с шума и постепенно переводит его в изображение, опираясь на текст и другие условия.

Что такое Stable Diffusion

Если убрать детали, Stable Diffusion — это семейство моделей, которые создают изображения из шума по тексту и дополнительным условиям. Слово diffusion относится к способу обучения и генерации, а Stable Diffusion — к названию семейства, а не к обещанию стабильного результата.

Для многих моделей опубликованы веса. Это позволяет запускать их локально, дообучать и встраивать в собственный pipeline, но права зависят от лицензии конкретного файла. Доступ к весам не означает автоматически open source, отсутствие ограничений или совместимость со всеми инструментами.

Откуда взялась

Исследовательской основой стала работа о latent diffusion: основная генерация проходит не по полному пиксельному изображению, а по более компактному скрытому представлению. Stability AI и партнёры использовали этот подход при выпуске ранних моделей Stable Diffusion.

С тех пор семейство расширялось:

  • 2022: SD 1.4 → 1.5
  • 2023: SDXL (улучшенная архитектура для больших разрешений)
  • 2024: SD 3 (новая архитектура), SD 3.5
  • после SDXL: новые поколения Stable Diffusion и отдельные семейства других разработчиков

Stable Diffusion 1.5 сохраняет ценность благодаря большой экосистеме LoRA и старых workflow. SDXL рассчитан на более высокое базовое разрешение и имеет собственную экосистему. Более новые семейства отличаются архитектурой, лицензиями и требованиями к оборудованию; сравнивать их лучше на нужном типе изображений.

Чем локальный pipeline отличается от облачного сервиса

В облачном генераторе провайдер управляет моделью, интерфейсом, обновлениями и ограничениями. Это снижает порог входа, но пользователь зависит от тарифов, доступности функций и правил обработки данных.

Локальный pipeline даёт больше контроля над весами, дополнениями и файлами. Взамен приходится следить за лицензиями, памятью, зависимостями и воспроизводимостью окружения. «Локально» также не означает автоматически бесплатно или приватно: остаются расходы на оборудование и риски программ, которые могут обращаться к сети.

Выбор проще делать по процессу: какие входы нужны, насколько точно должна сохраняться композиция, можно ли передавать материалы внешнему сервису и кто будет поддерживать сборку.

Как работает диффузия

Самая необычная часть Stable Diffusion — то, как именно она «превращает текст в картинку». Без формул, на пальцах.

Идея «обратной зашумления»

Представим чёткое фото кота. Если постепенно добавлять к нему случайный шум, исходное изображение в конце перестанет различаться.

Это forward process — прямой диффузионный процесс. Он простой: на каждом шаге добавляется немного гауссова шума.

А теперь — главный фокус. Что если обучить нейросеть обратному процессу? Дать ей зашумлённую картинку и попросить предсказать, как она выглядела на один шаг назад, до этой порции шума.

Обратный процесс использует обученную модель, чтобы поэтапно переводить шумное представление к более чистому. При генерации число вычислительных шагов задаётся sampler и может сильно отличаться от расписания, использованного во время обучения.

При генерации нового изображения:

  1. Стартуем с чистого шума — случайного, как телеэкран без сигнала.
  2. Подаём модели шум и текстовое условие через совместимый текстовый энкодер, который связывает текст с визуальными признаками.
  3. Модель предсказывает: «если бы это была зашумлённая картинка кота, как она выглядела бы на один шаг чище?»
  4. Применяем результат: чуть менее шумная картинка.
  5. Повторяем по расписанию выбранного sampler. Число шагов зависит от модели и способа её обучения.
  6. В конце — чёткое изображение.

Так выглядит упрощённая интуиция. В реальном pipeline модель может предсказывать шум, чистый образец или другую связанную величину, а численный метод переводит это предсказание в следующий latent.

Латентное пространство — главный фокус Stable Diffusion

Диффузия непосредственно в пикселях обрабатывает большой тензор на каждом шаге. Latent diffusion уменьшает рабочее пространственное представление и переносит основную часть вычислений в него.

Перед диффузией картинку сжимают через автоэнкодер — VAE. Форма latent, число каналов и коэффициент сжатия зависят от архитектуры модели.

Этот сжатый формат называется latent — латентное представление. Кодирование с потерями может изменить мелкие детали, цвет и фактуру, поэтому VAE остаётся частью качества всего pipeline.

Диффузия проводится в латентном пространстве. После sampling VAE декодирует latent обратно в пиксели. Выигрыш зависит от формы представления и стоимости самого denoiser.

Отсюда название Latent Diffusion Model. Сжатое представление сделало локальный запуск практичнее, но требования всё равно зависят от поколения модели, размера кадра, precision и offload.

Роль текста и CLIP

Текстовый энкодер превращает prompt в набор скрытых признаков, которые поступают в генеративную модель как условие. В ранних ветках Stable Diffusion использовались варианты CLIP; другие поколения могут сочетать несколько энкодеров или использовать иные семейства. Поэтому лимит текста, правила акцентов и даже значение одного слова зависят от архитектуры.

Семейство моделей

Понимать их — значит понимать, какие у вас на вход доступны инструменты.

SD 1.x — лёгкое поколение с большой экосистемой

Модели этой ветки обучались под сравнительно небольшой базовый размер кадра и обычно требуют меньше памяти, чем более крупные поколения. Для них накопилось много checkpoints, LoRA, Textual Inversion и ранних моделей ControlNet.

Когда подходит: когда уже есть совместимый набор дополнений, важен умеренный расход памяти или нужен старый воспроизводимый workflow.

Ограничения: мелкие детали, анатомия и текст внутри изображения часто требуют второго прохода. Высокое разрешение обычно получают не одним большим рендером, а апскейлом или поэтапной генерацией.

SDXL — зрелая экосистема для крупного базового кадра

SDXL рассчитана на больший базовый размер изображения и использует два текстовых энкодера. У неё есть опциональный refiner, хотя многие дообученные checkpoints обходятся без отдельного второго этапа.

Вокруг SDXL выросла самостоятельная экосистема LoRA, ControlNet и IP-Adapter. Дополнения от SD 1.x с ней несовместимы, даже если файлы выглядят одинаково.

Когда подходит: когда важны зрелые дополнения, готовые workflow и более крупный базовый кадр.

Ограничения: модель тяжелее SD 1.x, а точный расход памяти зависит от checkpoint, VAE, размера кадра и оптимизаций. Длинные надписи всё ещё приходится проверять и нередко доводить отдельно.

FLUX.1 / FLUX.2 — развитие семейства

Семейство FLUX от Black Forest Labs использует transformer-блоки и собственный набор текстовых энкодеров. Файлы заметно различаются по размеру, типу лицензии и числу шагов: название семейства не заменяет карточку конкретной версии.

Архитектура использует transformer-блоки и собственную схему текстового условия. Поведение на подробных инструкциях, надписях и сложной композиции зависит от точной версии и проверяется на нужных сценах.

Когда подходит: когда важны подробное следование инструкции, текст внутри кадра или совместимость с конкретным FLUX-workflow.

Ограничения: крупные варианты требуют больше памяти или offload. Совместимость LoRA и структурного контроля зависит от точной архитектуры, а коммерческие права — от лицензии выбранных весов.

SD 3.x — отдельная ветка Stability AI

SD 3.x перешла к архитектуре MMDiT и иному набору текстовых компонентов. Внутри ветки встречаются разные размеры и условия использования, поэтому переносить настройки, LoRA или выводы о качестве с одного релиза на другой нельзя.

Когда подходит: когда есть подходящий checkpoint, совместимые дополнения и понятная лицензия. Сравнение с SDXL или FLUX лучше проводить на одинаковых сценах, размерах и критериях, а не по месту в чужом рейтинге.

Видеомодели

Параллельно с картинками развиваются видеомодели на той же базе:

  • AnimateDiff — расширение к совместимым image-моделям для коротких анимаций
  • CogVideoX — открытая модель для генерации видео
  • Hunyuan Video, Wan и LTX-Video — отдельные семейства открытых видеомоделей с разными требованиями и лицензиями

Закрытые видеосервисы решают похожую пользовательскую задачу, но не раскрывают все детали моделей и меняют доступные режимы независимо от локальной экосистемы.

Три системы камер с разными креплениями показывают, что семейство модели выбирают по архитектуре, адаптерам, рабочим схемам, ресурсам и лицензии.
Разные поколения открытых моделей отличаются архитектурой, требованиями к памяти и экосистемой инструментов.

Параметры генерации

Локальные интерфейсы показывают больше параметров и позволяют явно собирать этапы процесса. Это даёт дополнительный контроль, но также требует следить за совместимостью и сохранять настройки вместе с результатом.

Печатная машина объединяет пять механизмов генерации: seed задаёт шум, steps — длину уточнения, guidance — силу условия, sampler — путь, scheduler — ритм шагов.
За простым полем «промпт» у Stable Diffusion живёт целый пульт настроек. Каждый параметр меняет генерацию в свою сторону — и каждый стоит понять.

Steps — количество шагов

Steps (шаги) — сколько итераций модель пройдёт от шума к чёткой картинке.

  • Слишком мало шагов может оставить незавершённые формы, если модель не обучена на ускоренный режим.
  • Больше шагов увеличивает время, но после точки насыщения не обязано улучшать результат.

Стартовое число берут из карточки точной модели или авторского workflow: обычный checkpoint и дистиллированная версия могут ожидать совсем разные расписания.

После некоторого числа шагов улучшение обычно замедляется или исчезает. Точка насыщения зависит от sampler, scheduler и того, была ли модель дистиллирована, поэтому её ищут короткой серией сравнений при фиксированном seed.

CFG Scale — сила следования промпту

CFG (Classifier-Free Guidance) — насколько строго модель следует промпту.

Низкое значение обычно оставляет текстовому условию меньше влияния, высокое усиливает его вместе с риском перенасыщения и артефактов. Шкала не универсальна: дистиллированная модель, отдельное поле guidance и классическая CFG могут использовать похожие числа по-разному.

Sampler и Scheduler

Sampler — алгоритм, который вычитает шум на каждом шаге. Их много: Euler, DPM++, DPM++ 2M Karras, UniPC, DDIM, LMS.

Scheduler — расписание, по которому распределяются «дозы» шума по шагам (Karras, Exponential, Normal, и т.д.).

Самые универсальные комбинации:

  • DPM++ 2M Karras — распространённая отправная точка для SDXL; для других семейств рекомендации могут отличаться
  • Euler a (Euler ancestral) — для творческих задач (даёт более вариативные результаты)
  • DDIM — для воспроизводимости с одного seed
  • UniPC — один из численных методов, доступный в некоторых реализациях

Для первого сравнения достаточно одной рекомендованной связки sampler и scheduler из карточки модели. Остальные варианты имеет смысл менять при одинаковом seed и числе шагов, чтобы разница была видна.

Seed — стартовый шум

Seed — число, которое определяет, какой именно случайный шум будет на старте. Тот же seed + тот же промпт + те же параметры = тот же результат. Каждый раз. Это критично для:

  • Воспроизводимости (поделиться результатом так, чтобы другой человек повторил)
  • Итеративной работы (зафиксировал seed, меняешь только промпт)
  • Сравнения параметров (с тем же seed разница между сэмплерами видна чище)

В UIs обычно есть кнопка «случайный seed» (-1) и «зафиксировать предыдущий».

Negative Prompt

Negative Prompt — что не должно быть на картинке.

Negative prompt задаёт нежелательные признаки, но не гарантирует их удаление. Поддержка зависит от модели: один pipeline использует отдельную отрицательную ветвь, другой — иной механизм guidance или вовсе работает без неё.

Aspect Ratio и Resolution

Aspect Ratioсоотношение сторон. Диффузионные модели обучаются на определённом распределении размеров и buckets. Слишком далёкая от него форма может ухудшить композицию или повторить объекты. Проверенные размеры берут из карточки точной модели и её официального workflow.

Denoising Strength (для img2img)

Denoising Strength — насколько сильно модель будет менять входное изображение в img2img режиме.

  • 0 = без изменений (модель не работает).
  • 0.3-0.5 = тонкая корректировка (стилизация, лёгкая правка).
  • 0.6-0.8 = значительная переработка с сохранением композиции.
  • 1.0 = полная перегенерация (входная картинка игнорируется).

Инструменты — где запускать

Базовая модель — это файл с весами (.safetensors или .ckpt). Чтобы с ним работать, нужен интерфейс.

ComfyUI — нодовый редактор для воспроизводимых процессов

ComfyUI — нодовый редактор для сборки воспроизводимых workflow. В нём блоки соединяются в граф: «загрузить модель» → «токенизировать промпт» → «KSampler» → «декодировать VAE» → «сохранить картинку».

Плюсы:

  • Явная схема: видны этапы генерации и связи между ними.
  • Воспроизводимость: весь pipeline сохраняется как JSON.
  • Расширяемость: Custom Nodes добавляют новые модели и операции.
  • Управление ресурсами: расход памяти можно видеть и менять на уровне конкретного workflow.
  • Воспроизводимость: граф можно сохранить, передать и повторить с теми же узлами и настройками.

Минусы:

  • Сложнее на старте. Требует понимания, что делают блоки.
  • Граф требует привыкнуть к типам входов, выходов и связям между узлами.

Менеджмент: встроенный ComfyUI Manager управляет custom nodes, моделями, missing nodes и снимками окружения. В Desktop он включён по умолчанию; в других сборках может потребоваться штатное включение.

Workflow можно сохранить как JSON и отправить коллеге — он откроет в своём ComfyUI ровно тот же pipeline.

AUTOMATIC1111 / Forge — UI с вкладками

AUTOMATIC1111 — веб-интерфейс с вкладками txt2img, img2img, inpaint и extensions. Он удобен для поддерживаемых моделей и старых проектов, но совместимость каждого нового checkpoint проверяют отдельно.

Forge — отдельный проект с похожей формой интерфейса и собственным backend. Производительность и совместимость сравнивают на одной модели и workflow.

Плюсы:

  • Понятный UI с первого взгляда: поле для промпта, кнопка Generate.
  • Огромное количество расширений (Dynamic Prompts, Wildcards, Regional Prompter).
  • Простой старт для новичков.

Минусы:

  • Поддержка конкретных новых архитектур и расширений зависит от версии интерфейса или форка.
  • Сложные разветвлённые процессы труднее увидеть целиком, чем в нодовом графе.

A1111 и Forge подходят тем, кому удобнее работать с формой и вкладками. ComfyUI удобнее там, где важны явные связи между этапами и повторяемость сложного процесса.

Fooocus — интерфейс с минимумом ручных настроек

Fooocus — интерфейс, который скрывает большую часть технических параметров и предлагает готовые настройки поверх SDXL.

Плюсы: простота. Установил, запустил, написал промпт — получил красивую картинку. Минусы: часть внутренних этапов скрыта. Когда важны нестандартные ветвления и точная воспроизводимость, удобнее интерфейс, который показывает весь граф.

Облачные сервисы

Если локального GPU недостаточно, остаются три устойчивых варианта: API с оплатой за запрос, аренда отдельной машины с собственным ComfyUI или готовый веб-сервис. Перед выбором важны не только цена, но и срок хранения файлов, доступ к моделям, ограничения лицензии и возможность выгрузить workflow.

Локальное железо

Для локальной работы важны объём памяти, поддержка нужного backend и доступность подходящих сборок. Большой запас VRAM упрощает работу с тяжёлыми моделями, крупным кадром и несколькими ControlNet; при меньшем объёме помогают quantization, offload, tiled-операции и более лёгкие checkpoints.

На Apple Silicon доступны собственные оптимизации, а на NVIDIA — CUDA-экосистема. Скорость зависит от модели, реализации и объёма памяти, поэтому сравнение по одному коэффициенту быстро устаревает.

Управление: LoRA, ControlNet, IP-Adapter

Голый Stable Diffusion даёт «средний» результат — то, чему модель училась в общем. Чтобы сделать что-то специфическое — стиль, персонажа, композицию, нужны управляющие модули.

LoRA — стиль и персонаж за выходные

LoRA (Low-Rank Adaptation) — техника лёгкого дообучения модели. Вы берёте базовую SD/SDXL/FLUX и обучаете на 20-200 картинках в нужном стиле. На выходе — маленький файл (50-300 МБ), который подключается к базовой модели и сдвигает её в нужную сторону.

Что бывает:

  • LoRA на стиль (винтаж, аниме, акварель, киберпанк)
  • LoRA на персонажа (узнаваемый герой)
  • LoRA на концепцию (определённая поза, определённый тип съёмки)
  • LoRA на объект (продукт бренда, локацию)

Небольшую LoRA часто можно обучить на одной мощной потребительской видеокарте или арендованном облачном GPU. Время и стоимость зависят от модели, датасета, разрешения и настроек обучения.

Civitai (civitai.com) — один из крупных каталогов моделей и LoRA. Перед скачиванием важны карточка, лицензия, базовая модель и отзывы о файле.

Сила LoRA контролируется множителем вроде <lora:my_style:0.7>. Это коэффициент влияния в конкретном загрузчике, а не буквальные «70% стиля». Рабочее значение зависит от адаптера, базовой модели и сочетания с другими LoRA.

Несколько LoRA можно стекировать, но осторожно — конфликты дают артефакты.

ControlNet — управление композицией

ControlNet — способ добавить структурное условие: позу, глубину, контуры, сегментацию или другую карту, поддерживаемую конкретной моделью контроля.

Виды:

  • OpenPose — задать позу персонажа через scaleboard-человечка
  • Depth Map — задать глубину сцены (где близко, где далеко)
  • Canny Edge — задать контуры всей композиции
  • Segmentation Map — задать «здесь будет небо, здесь дом, здесь поле»
  • Lineart — задать чёрно-белые контуры (для иллюстрации)
  • Scribble — нарисовать черновик, модель допишет
  • Tile — апскейлинг + детализация
  • InstructP2P — текстовые инструкции типа «измени в стиле акварель»

ControlNet уменьшает случайность в выбранном аспекте композиции, но не делает результат точной копией карты. Для одних задач достаточно prompt и референса, для других структурный контроль действительно становится главным инструментом.

IP-Adapter — референс по картинке

IP-Adapter — extension, похожий на ControlNet, но управляет стилем и содержимым через референсную картинку.

Сценарий: «нарисуй портрет в стиле этого старого фото» — даёте картинку как референс, IP-Adapter переносит стиль/цвет/композицию.

Особенно мощно работает связка IP-Adapter Face — переносить лицо с фото в генерацию. С его помощью можно делать узнаваемые портреты без обучения LoRA на персонаже.

Regional Prompting

Regional Prompting — приём, при котором разные части картинки получают разные промпты. Левая половина — пейзаж, правая — портрет. Верхняя четверть — небо, остальное — город.

Делается через специальные расширения (Regional Prompter в A1111, нативные ноды в ComfyUI).

Полезно для сложных композиций, где простой текст не справляется.

Embeddings и Textual Inversion

Textual Inversion обучает небольшое текстовое представление нового понятия. Это другой механизм, чем LoRA: он легче по числу обучаемых параметров, но по-разному подходит стилям, объектам и конкретным энкодерам.

Hypernetwork — ещё одна старая техника.

Четыре карты одной танцевальной сцены передают ControlNet позу, глубину, контуры и области, а итоговый кадр сохраняет заданную структуру движения.
ControlNet превращает SD из «придумай картинку» в «нарисуй конкретное по моему скетчу». Поза, глубина, контуры, сегментация — каждый режим закрывает свой сценарий.

Img2img, Inpainting, Outpainting

Stable Diffusion работает не только в режиме «текст → картинка», но и в картинка → картинка через несколько техник.

Img2img — переделать существующее

Img2img — даёте модели исходную картинку и промпт. Она перерисовывает её в нужном направлении.

Параметр Denoising Strength контролирует, насколько глубоко процесс уходит от входного latent. Низкие значения обычно сохраняют больше исходника, высокие дают модели больше свободы. Точная граница зависит от sampler, числа шагов, модели и способа encode, поэтому её находят серией с фиксированным seed.

Применения:

  • Стилизация фото
  • Доработка плохой генерации
  • Перенос концепции через несколько итераций (текст → черновик → детализация → финал)

Inpainting — перерисовать кусок

Inpainting — выделяете маской область картинки и перерисовываете только её, оставляя остальное.

Применения:

  • Заменить лицо
  • Убрать объект (например, столб на фото)
  • Добавить деталь («теперь у этой женщины серьги»)
  • Исправить руки/анатомию

Для inpainting нужна специальная inpaint-модель (или используется обычная с режимом маски). Качество зависит от маски — чем точнее обведено, тем чище результат.

Outpainting — расширить границы

Outpainting — продолжить картинку за её исходные границы.

Применения:

  • Превратить 1:1 в 16:9 (для постера или баннера)
  • Расширить кадр для широкоэкранного видео
  • Добавить фон вокруг центрального объекта

Outpainting технически — это inpainting на «пустых» областях за пределами оригинала. Работает хуже, чем inpainting в центре, но в современных моделях (FLUX особенно) — уже на хорошем уровне.

Upscaling и доводка

Большая часть финальной работы — это апскейлинг и детализация.

Upscaler — увеличивает размер картинки (1024 → 2048, 4096, 8192). Используют:

  • ESRGAN и его варианты (RealESRGAN, 4x-UltraSharp) — лёгкие, быстрые
  • Tile-based upscaling — большую картинку разбивают на тайлы и каждый прогоняют через SD (tile diffusion)
  • Topaz Gigapixel — отдельный коммерческий продукт для апскейлинга
  • SUPIR — фронтирный апскейлер с пониманием контента

Face Restoration — отдельная нейросеть для восстановления лиц (CodeFormer, GFPGAN). Полезно, когда лицо в генерации деформировано или нечёткое.

От картинки к видео

Анимационные модули на базе SD

AnimateDiff и похожие модули добавляют к совместимой модели временные связи. Пайплайн генерирует не отдельные независимые кадры, а последовательность, где движение и детали стараются сохраняться во времени.

Такой подход подходит для коротких движений, лупов и экспериментов с управлением позой. Длина, разрешение и стабильность зависят от motion-модуля, памяти, контекста и базовой модели.

Семейства открытых видеомоделей

Hunyuan Video (Tencent) — семейство открытых весов для генерации видео. Длина, разрешение, объём весов и требования зависят от конкретной версии и способа запуска.

Wan, LTX-Video и другие открытые семейства решают похожую задачу с разными требованиями к памяти, длительности и управлению. Их сравнивают на одинаковой сцене и готовом workflow, а точную версию фиксируют вместе с проектом.

Закрытые видеосервисы

Runway, Kling и Pika — примеры закрытых сервисов для генерации AI-видео. Их полезнее сравнивать по поддержке референсов, управлению камерой, длительности непрерывного кадра, политике хранения данных, возможности коммерческого использования и итоговой стоимости удачного дубля. Названия моделей, тарифы и лимиты меняются быстрее этих критериев.

text-to-video vs image-to-video

Text-to-Video — генерация видео из текстового промпта без заранее заданного кадра.

Image-to-Video — оживление статической картинки. Начальный кадр уже задаёт композицию и внешность объектов, но движение всё равно может нарушить детали.

Image-to-video удобно, когда важен заранее подготовленный первый кадр. Text-to-video оставляет модели больше свободы. В реальном проекте оба подхода могут сочетаться с монтажом и обычной графикой.

С чем не путать

Stable DiffusionMidjourney. Stable Diffusion — семейство весов и локальных инструментов, а Midjourney — закрытый облачный сервис. Разница прежде всего в контроле над средой, workflow и данными, а не в универсальном месте по качеству или цене.

Stable Diffusion ≠ генератор изображений OpenAI. Это разные продуктовые линии: у Stable Diffusion есть распространяемые веса и локальные интерфейсы, а сервис OpenAI работает через облачные продукты и API.

SD 1.x ≠ SDXL ≠ FLUX. Это разные архитектурные семейства. LoRA и ControlNet совместимы только с той базой, под которую обучены; нужная архитектура указана в карточке дополнения.

Stable Diffusion ≠ Stability AI. Stable Diffusion — название семейства моделей, Stability AI — компания. FLUX выпускает Black Forest Labs и относится к другой линейке, даже если проекты исторически связаны людьми из одной исследовательской команды.

ComfyUI ≠ Stable Diffusion. ComfyUI — это интерфейс и среда выполнения графов. Он поддерживает разные семейства изображений, видео и другие совместимые модели через встроенные и сторонние ноды.

Latent ≠ Pixel. Картинка в latent space — это не то, что видит глаз. Это сжатое представление, понятное только VAE. Чтобы увидеть финальную картинку — нужно декодировать через VAE.

Inpainting model ≠ обычная модель. Для качественного inpaint нужна специальная inpaint-версия модели (или техника latent inpaint в ComfyUI). Обычная модель в режиме маски иногда даёт швы и артефакты.

Частые ошибки и заблуждения

«Закрытые сервисы полностью заменяют локальные модели». Эти подходы решают разные задачи. Облако проще начать использовать, а открытые веса дают локальный запуск, доступ к workflow и возможность настраивать модель. Иногда проект сочетает оба варианта.

«Хорошие картинки — это секретный промпт». Результат складывается из модели, референсов, LoRA, структурного контроля, настроек и постобработки. Один промпт не заменяет весь процесс.

«Чем длиннее промпт — тем лучше». Нет. Результат зависит от того, какие понятия понимает текстовый энкодер и не противоречат ли детали друг другу. Несколько точных признаков сцены обычно полезнее длинной гирлянды усилителей качества.

SDXL и FLUX — разные зрелые экосистемы. Подходящее семейство определяется совместимостью workflow, лицензией, памятью и нужным типом изображения.

«Параметры можно не понимать». Готовый preset действительно даёт старт, но знание роли sampler, scheduler, steps и denoise помогает менять результат осмысленно и возвращаться к удачной версии.

«Negative prompt всегда нужен». Нет. Одни архитектуры обучены с отдельным отрицательным условием, другие его не используют или обрабатывают иначе. Это свойство конкретного pipeline.

«Чем больше LoRA, тем лучше». Несколько адаптеров могут конфликтовать за одни и те же признаки. Рабочую комбинацию ищут по одному изменению за раз, сохраняя seed и остальные параметры.

«Статус AI-изображения одинаков во всех странах». Нет. Авторское право, лицензия модели, права на исходники и правила площадки — разные слои. Для коммерческого проекта их проверяют в нужной юрисдикции и на дату публикации.

«AI либо полностью заменяет художника, либо бесполезен». В реальном процессе генерация может отвечать за поиск вариантов, черновой фон или ретушь, а композицию, отбор, права и финальную подачу держит человек. Граница меняется от проекта к проекту.

Карта дальше — куда копать

Если вы только начинаете:

Архитектура:

Семейство моделей:

  • SDXL — рабочая лошадка
  • FLUX — семейство генеративных моделей Black Forest Labs
  • Refiner — доводка деталей

Управление:

Режимы работы:

  • Img2img — переделать существующую
  • Inpainting — перерисовать кусок
  • Outpainting — расширить границы
  • Upscaler — увеличить размер
  • Face Restoration — восстановить лицо

Параметры:

Альтернативные модели:

Видео:

Дообучение:

Технические нюансы:

Большие разборы:

Или полный каталог словаря: 156 терминов — копайте по любым веткам.

Частые вопросы

Что нужно для запуска SD локально?

  • Устройство и backend, которые поддерживает выбранная сборка.
  • Достаточно RAM/VRAM для точного checkpoint, VAE и размера кадра либо рабочий offload.
  • Запас места под веса, кэш и результаты.
  • Интерфейс вроде ComfyUI, AUTOMATIC1111 или совместимого форка.

Требования лучше брать из карточки конкретной модели: внутри одного семейства встречаются варианты разного размера и точности.

Что лучше для начинающих — ComfyUI или A1111? A1111/Forge предлагает форму с привычными полями, а ComfyUI — граф из узлов. Первый подход проще для одиночной генерации, второй удобнее для повторяемого многоэтапного процесса. Выбор зависит от сложности workflow, а не от уровня «серьёзности» пользователя.

Где брать модели? Надёжная точка входа — страница разработчика модели и репозиторий, на который она ссылается. В каталогах вроде Hugging Face и Civitai важно проверить автора, базовую архитектуру, лицензию, хеш файла и список необходимых компонентов.

Что лучше — FLUX или SDXL? Это разные архитектуры и экосистемы дополнений. Выбор зависит от нужных LoRA и моделей контроля, лицензии, памяти и поведения на ваших сценах. Сравнивать их полезно на одинаковом наборе задач, а не по общей таблице качества.

Можно ли коммерчески использовать AI-картинки? Зависит от лицензии точной версии модели, условий сервиса, прав на исходные материалы и юрисдикции. Название семейства не гарантирует одинаковых условий для всех checkpoints. Для коммерческого проекта нужна карточка конкретных весов или действующие условия облачного сервиса; при существенном риске — консультация специалиста по нужной стране.

Сколько времени уходит на генерацию? Время определяют модель, разрешение, число шагов, batch size, точность весов, offload и видеокарта. Поэтому полезнее измерить один и тот же workflow на своём компьютере, чем переносить готовую цифру из чужого теста.

Как сделать стиль конкретного фотографа/художника? Сначала стоит определить, какие свойства нужны на самом деле: свет, палитра, фактура, композиция или узнаваемые мотивы. Их можно задать описанием, лицензированными референсами, IP-Adapter либо собственной LoRA на материалах, для которых есть права. Так результат легче контролировать, чем запросом на прямое копирование живого автора.

Что такое CFG > 10? Слишком высокий CFG может приводить к перенасыщенным цветам и артефактам. Рабочий диапазон зависит от семейства модели, поэтому начальное значение берут из её карточки или готового workflow.

Почему руки получаются плохими? Кисти занимают мало пикселей, имеют много возможных положений и легко перекрываются предметами. Ошибки встречаются в любом семействе, хотя частота различается. Обычно помогает более крупный исходный кадр, точная поза, локальный inpainting и проверка на финальном размере.

Что такое hi-res fix? Hi-res fix — двухпроходный приём: сначала строится композиция в подходящем для модели размере, затем изображение увеличивается и уточняется через img2img с умеренным denoising. Он полезен не для каждой архитектуры и может изменить лицо или мелкие предметы, поэтому результат сравнивают с прямой генерацией нужного размера.

Можно ли заработать на Stable Diffusion? Stable Diffusion используют в иллюстрации, предвизуализации, прототипах, ретуши и подготовке вариантов. Коммерческая ценность появляется не из самой кнопки генерации, а из решённой задачи, редакторского качества и понятных прав на модель, дополнения и исходные материалы.

Универсальной «финальной сборки» здесь нет. Её проще собрать слоями:

  1. Оборудование: достаточно памяти для выбранной модели, точности и размера кадра.
  2. Интерфейс: ComfyUI с встроенным Manager или интерфейс с формой, если граф не нужен.
  3. Базовая модель: вариант, совместимый с нужными LoRA, ControlNet и лицензией проекта.
  4. Управление сценой: только те модули контроля, которые действительно улучшают повторяемость.
  5. Апскейл и ретушь: отдельный проверяемый этап, а не обязательная марка программы.
  6. Видео: модель и способ запуска под нужную длительность, движение и бюджет вычислений.

Главное

Stable Diffusion сделала локальную генерацию изображений массово доступной и стала основой большой экосистемы моделей, LoRA и интерфейсов. Она продолжает использоваться рядом с другими открытыми семействами и облачными сервисами.

Основные принципы:

  1. SD — это семейство моделей, а не одна модель. У поколений различаются разрешение, архитектура, лицензия и совместимые дополнения.
  2. Условия решают разные задачи. Prompt описывает сцену, а LoRA, ControlNet и IP-Adapter меняют или фиксируют отдельные свойства.
  3. Интерфейс определяет форму работы. ComfyUI удобен для графов и воспроизводимости, формы — для быстрых одиночных запусков.
  4. Параметры связаны между собой. Steps, CFG, sampler и scheduler сравниваются при одинаковых остальных условиях.
  5. Лицензия относится к точному файлу. У базовой модели, LoRA, контрольного модуля и сервиса могут быть разные условия.

Первые результаты редко показывают предел модели или автора. Стабильность появляется, когда сохраняются удачные workflow, меняется по одному параметру за раз и остаётся понятный набор тестовых сцен.

Связанные понятия собраны в словаре. Короткие повторяемые сравнения с одним изменённым параметром помогают увидеть, за какую часть изображения отвечает каждая настройка.

Карта дальше — термины из словаря

Если хотите идти глубже — вот все термины, упомянутые в этом гиде. Можно открыть в новой вкладке и читать параллельно.