Большой разбор
Stable Diffusion: полный гид по генерации изображений и видео
Stable Diffusion — семейство генеративных моделей и большая экосистема локальных инструментов. Модели можно запускать через ComfyUI и другие интерфейсы, дополнять совместимыми LoRA, ControlNet и референсами. В гиде разберём устройство диффузии, различия архитектур и способ собрать повторяемый процесс без универсальных «лучших настроек».
Быстрый вход
В двух минутах
Stable Diffusion — семейство генеративных моделей и большая экосистема локальных инструментов. Модели можно запускать через ComfyUI и другие интерфейсы, дополнять совместимыми LoRA, ControlNet и референсами. В гиде разберём устройство диффузии, различия архитектур и способ собрать повторяемый процесс без универсальных «лучших настроек».
- Модель, интерфейс и рабочая схема
- Что такое Stable Diffusion
- Как работает диффузия
Модель, интерфейс и рабочая схема
Публикация ранних весов Stable Diffusion в 2022 году сделала локальную генерацию изображений доступной широкой аудитории. Вокруг моделей появились интерфейсы, адаптеры, способы структурного контроля и тысячи пользовательских workflow.
С тех пор название стало неоднозначным. Им называют исходные модели Stability AI, совместимые дообучения, весь набор инструментов для локальной генерации и иногда даже соседние архитектуры. Для практической работы полезнее разделять четыре вещи:
- базовую архитектуру и конкретные веса;
- лицензию модели и дополнений;
- интерфейс, в котором собран процесс;
- workflow со всеми загрузчиками, энкодерами и параметрами.
Этот гид объясняет, как эти части связаны и почему файл с похожим расширением не обязательно подходит к другому поколению модели.
Что такое Stable Diffusion
Если убрать детали, Stable Diffusion — это семейство моделей, которые создают изображения из шума по тексту и дополнительным условиям. Слово diffusion относится к способу обучения и генерации, а Stable Diffusion — к названию семейства, а не к обещанию стабильного результата.
Для многих моделей опубликованы веса. Это позволяет запускать их локально, дообучать и встраивать в собственную систему, но права зависят от лицензии конкретного файла. Доступ к весам не означает автоматически open source, отсутствие ограничений или совместимость со всеми инструментами.
Откуда взялась
Исследовательской основой стала работа о latent diffusion: основная генерация проходит не по полному пиксельному изображению, а по более компактному скрытому представлению. Stability AI и партнёры использовали этот подход при выпуске ранних моделей Stable Diffusion.
Несколько заметных этапов развития:
- 2022: SD 1.4 → 1.5
- 2023: SDXL (улучшенная архитектура для больших разрешений)
- 2024: SD 3 (новая архитектура), SD 3.5
Stable Diffusion 1.5 сохраняет ценность благодаря большой экосистеме LoRA и старых workflow. SDXL рассчитан на более высокое базовое разрешение и имеет собственную экосистему. Другие семейства отличаются архитектурой, лицензиями и требованиями к оборудованию; сравнивать их лучше на нужном типе изображений.
Чем локальный процесс отличается от облачного сервиса
В облачном генераторе провайдер управляет моделью, интерфейсом, обновлениями и ограничениями. Это снижает порог входа, но пользователь зависит от тарифов, доступности функций и правил обработки данных.
Локальный процесс даёт больше контроля над весами, дополнениями и файлами. Взамен приходится следить за лицензиями, памятью, зависимостями и воспроизводимостью окружения. «Локально» также не означает автоматически бесплатно или приватно: остаются расходы на оборудование и риски программ, которые могут обращаться к сети.
Выбор проще делать по процессу: какие входы нужны, насколько точно должна сохраняться композиция, можно ли передавать материалы внешнему сервису и кто будет поддерживать сборку.
Как работает диффузия
Начнём с диффузионной схемы ранних Stable Diffusion и SDXL. Она помогает понять генерацию из шума, хотя устройство и обучение других поколений могут отличаться.
От изображения к шуму и обратно
Представим чёткое фото кота. Если постепенно добавлять к нему случайный шум, исходное изображение в конце перестанет различаться.
Это forward process — прямой диффузионный процесс. В распространённой схеме сигнал ослабляется и к нему добавляется гауссов шум по заданному расписанию. Для обучения нужный уровень можно получить сразу, без последовательного прохождения всех предыдущих шагов.
На таких примерах модель обучают прогнозировать величину, которая помогает двигаться в обратную сторону: например, добавленный шум. Это не восстановление единственного достоверного оригинала из случайного массива. Модель использует закономерности обучающих данных, чтобы получить правдоподобное изображение.
Обратный процесс использует обученную модель, чтобы поэтапно переводить шумное представление к более чистому. При генерации число вычислительных шагов задаётся настройками сэмплирования и может сильно отличаться от расписания, использованного во время обучения.
При генерации нового изображения:
- Стартуем с чистого шума — случайного, как телеэкран без сигнала.
- Подаём модели шум и текстовое условие через совместимый текстовый энкодер, который связывает текст с визуальными признаками.
- Модель выдаёт прогноз с учётом текущего состояния и условия «кот».
- Сэмплер использует прогноз, чтобы получить следующее состояние.
- Повторяем по расписанию выбранного sampler. Число шагов зависит от модели и способа её обучения.
- В конце латентное представление декодируется в изображение, которое остаётся проверить.
Так выглядит упрощённая интуиция. В реальной системе модель может предсказывать шум, чистый образец или другую связанную величину, а численный метод переводит это предсказание в следующий latent.
Зачем нужно латентное пространство
Диффузия непосредственно в пикселях обрабатывает большой тензор на каждом шаге. Latent diffusion уменьшает рабочее пространственное представление и переносит основную часть вычислений в него.
При обучении и в img2img картинку кодируют через автоэнкодер — VAE. Форма латентного массива, число каналов и коэффициент сжатия зависят от архитектуры модели. При генерации по одному тексту исходной картинки нет: сэмплирование начинается с шума в этом пространстве.
Этот сжатый формат называется latent — латентное представление. Кодирование с потерями может изменить мелкие детали, цвет и фактуру, поэтому VAE остаётся частью качества всего процесса.
Диффузия проводится в латентном пространстве. После sampling VAE декодирует latent обратно в пиксели. Выигрыш зависит от формы представления и затрат на вычисления основной генеративной модели.
Отсюда название Latent Diffusion Model. Сжатое представление сделало локальный запуск практичнее, но требования всё равно зависят от поколения модели, размера кадра, точности вычислений и переноса части данных из видеопамяти в оперативную память — offload.
Роль текста и CLIP
Текстовый энкодер превращает prompt в набор скрытых признаков, которые поступают в генеративную модель как условие. В ранних ветках Stable Diffusion использовались варианты CLIP; другие поколения могут сочетать несколько энкодеров или использовать иные семейства. Поэтому лимит текста, правила акцентов и даже значение одного слова зависят от архитектуры.
Stable Diffusion и соседние семейства
От архитектуры зависит, какие загрузчики, энкодеры и дополнения можно соединить в одной схеме. Совпадение расширения файла не означает совместимость.
SD 1.x — лёгкое поколение с большой экосистемой
Модели этой ветки обучались под сравнительно небольшой базовый размер кадра и обычно требуют меньше памяти, чем более крупные поколения. Для них накопилось много checkpoints, LoRA, Textual Inversion и ранних моделей ControlNet.
Когда подходит: когда уже есть совместимый набор дополнений, важен умеренный расход памяти или нужен старый воспроизводимый workflow.
Ограничения: мелкие детали, анатомия и текст внутри изображения часто требуют второго прохода. Высокое разрешение обычно получают не одним большим рендером, а апскейлом или поэтапной генерацией.
SDXL — зрелая экосистема для крупного базового кадра
SDXL рассчитана на больший базовый размер изображения и использует два текстовых энкодера. У неё есть опциональный refiner, хотя многие дообученные checkpoints обходятся без отдельного второго этапа.
Вокруг SDXL выросла самостоятельная экосистема LoRA, ControlNet и IP-Adapter. Дополнения от SD 1.x с ней несовместимы, даже если файлы выглядят одинаково.
Когда подходит: когда важны зрелые дополнения, готовые workflow и более крупный базовый кадр.
Ограничения: модель тяжелее SD 1.x, а точный расход памяти зависит от checkpoint, VAE, размера кадра и оптимизаций. Длинные надписи всё ещё приходится проверять и нередко доводить отдельно.
FLUX — отдельное семейство Black Forest Labs
Семейство FLUX от Black Forest Labs использует transformer-блоки и собственный набор текстовых энкодеров. Файлы заметно различаются по размеру, типу лицензии и числу шагов: название семейства не заменяет карточку конкретной версии.
Это не поколение Stable Diffusion. Поведение на подробных инструкциях, надписях и сложной композиции зависит от точной версии и проверяется на нужных сценах.
Когда подходит: когда важны подробное следование инструкции, текст внутри кадра или совместимость с конкретным FLUX-workflow.
Ограничения: крупные варианты требуют больше памяти или offload. Совместимость LoRA и структурного контроля зависит от точной архитектуры, а коммерческие права — от лицензии выбранных весов.
SD 3.x — отдельная ветка Stability AI
В SD 3.x используются архитектура MMDiT, иной набор текстовых компонентов и обучение на основе rectified flow. Поэтому объяснение ранней диффузии не стоит переносить на эту ветку буквально. Внутри ветки встречаются разные размеры и условия использования, поэтому переносить настройки, LoRA или выводы о качестве с одного релиза на другой нельзя.
Когда подходит: когда есть подходящий checkpoint, совместимые дополнения и понятная лицензия. Сравнение с SDXL или FLUX лучше проводить на одинаковых сценах, размерах и критериях, а не по месту в чужом рейтинге.
Видеомодели
Для видео есть как расширения моделей изображений, так и самостоятельные семейства:
- AnimateDiff — расширение к совместимым моделям изображений для коротких анимаций
- CogVideoX — семейство моделей с опубликованными весами для генерации видео
- Hunyuan Video, Wan и LTX-Video — отдельные семейства видеомоделей с опубликованными весами с разными требованиями и лицензиями
Закрытые видеосервисы решают похожую пользовательскую задачу, но не раскрывают все детали моделей и меняют доступные режимы независимо от локальной экосистемы.
Параметры генерации
Локальные интерфейсы показывают больше параметров и позволяют явно собирать этапы процесса. Это даёт дополнительный контроль, но также требует следить за совместимостью и сохранять настройки вместе с результатом.
Steps — количество шагов
Steps (шаги) — число шагов сэмплирования. Это не обязательно число вызовов модели: некоторые методы делают несколько вычислений на шаг.
- Слишком мало шагов может оставить незавершённые формы, если модель не обучена на ускоренный режим.
- Больше шагов увеличивает время, но после точки насыщения не обязано улучшать результат.
Стартовое число берут из карточки точной модели или авторского workflow: обычный checkpoint и дистиллированная версия могут ожидать совсем разные расписания.
Точку, после которой дополнительные шаги мало помогают, удобно искать короткой серией сравнений при фиксированном seed, а затем проверять на других сценах.
CFG Scale — сила следования промпту
CFG (Classifier-Free Guidance) усиливает разницу между прогнозами с положительными и опорными условиями. В качестве опорного условия может использоваться пустой или отрицательный промпт. Это способ направить генерацию, а не численная оценка точности выполнения инструкции.
Низкое значение обычно оставляет текстовому условию меньше влияния, высокое усиливает его вместе с риском перенасыщения и артефактов. Шкала не универсальна: дистиллированная модель, отдельное поле guidance и классическая CFG могут использовать похожие числа по-разному.
Sampler и Scheduler
Sampler — алгоритм, который использует прогноз модели для перехода к следующему состоянию. Примеры — Euler, DPM++ 2M, UniPC, DDIM и LMS. Некоторые методы также добавляют шум на промежуточных шагах.
Scheduler — расписание, по которому распределяются «дозы» шума по шагам (Karras, Exponential, Normal, и т.д.).
В названии DPM++ 2M Karras объединены две настройки: сэмплер DPM++ 2M и расписание Karras. В ComfyUI они выбираются отдельно. Буква a в Euler a означает ancestral-вариант с добавлением шума по ходу генерации, а не специальный режим творчества. Воспроизводимость DDIM также зависит от параметров и окружения; это не уникальная гарантия данного метода.
Для первого сравнения достаточно одной рекомендованной пары сэмплера и расписания из карточки модели. Остальные варианты имеет смысл менять при одинаковом seed и числе шагов, чтобы разница была видна.
Seed — стартовый шум
Seed — число, которое определяет, какой именно случайный шум будет на старте. При совпадении модели, входных данных, настроек и вычислительного окружения фиксированный seed помогает повторить результат. Но побитовое совпадение между разными устройствами и версиями программ не гарантировано. Seed полезен для:
- Воспроизводимости (поделиться результатом так, чтобы другой человек повторил)
- Итеративной работы (зафиксировал seed, меняешь только промпт)
- Сравнения параметров (с тем же seed разница между сэмплерами видна чище)
В интерфейсах есть разные способы управления seed. Например, значение -1 в некоторых программах означает случайный выбор, а ComfyUI использует режим изменения seed после генерации. Переносить обозначение из одного интерфейса в другой без проверки не стоит.
Negative Prompt
Negative Prompt — что не должно быть на картинке.
Negative prompt задаёт нежелательные признаки, но не гарантирует их удаление. Поддержка зависит от модели: один pipeline использует отдельную отрицательную ветвь, другой — иной механизм guidance или вовсе работает без неё.
Aspect Ratio и Resolution
Aspect Ratio — соотношение сторон. Диффузионные модели обучаются на определённом распределении размеров. При обучении изображения могут группировать в buckets — группы близких размеров и пропорций. Слишком далёкая от него форма может ухудшить композицию или повторить объекты. Проверенные размеры берут из карточки точной модели и её официального workflow.
Denoising Strength (для img2img)
Denoising Strength — насколько сильно модель будет менять входное изображение в img2img режиме.
В типичном img2img уменьшение denoise снижает начальное зашумление и помогает сохранить больше исходной структуры. Значение 1.0 использует полное расписание, но не отменяет другие условия: маску, референсы или ControlNet. При 0 сэмплирование обычно пропускается; если картинка всё равно прошла через VAE, её пиксели могут измениться.
Фиксированных диапазонов «лёгкая правка» и «сохранение композиции» нет. Особенно важно, что произошло с входом до сэмплирования: если область маски была очищена, низкий denoise не восстановит её прежнее содержимое автоматически.
Инструменты — где запускать
Для запуска нужны веса и программа, которая поддерживает их архитектуру. Модель может храниться одним checkpoint или набором компонентов. Удобный интерфейс не обязателен технически — запуск возможен и из кода, — но помогает управлять настройками.
ComfyUI — нодовый редактор для воспроизводимых процессов
ComfyUI — нодовый редактор для сборки воспроизводимых workflow. В нём блоки соединяются в граф: «загрузить модель» → «токенизировать промпт» → «KSampler» → «декодировать VAE» → «сохранить картинку».
Плюсы:
- Явная схема: видны этапы генерации и связи между ними.
- Сохранение схемы: граф и его параметры можно записать в JSON.
- Расширяемость: Custom Nodes добавляют новые модели и операции.
- Управление ресурсами: расход памяти можно видеть и менять на уровне конкретного workflow.
Минусы:
- Сложнее на старте. Требует понимания, что делают блоки.
- Граф требует привыкнуть к типам входов, выходов и связям между узлами.
Менеджмент: встроенный ComfyUI Manager управляет custom nodes, моделями, missing nodes и снимками окружения. В Desktop он включён по умолчанию; в других сборках может потребоваться штатное включение.
Workflow можно сохранить как JSON и отправить коллеге — он сможет открыть схему. Но JSON не содержит сами веса, дополнительные узлы и Python-зависимости: их понадобится установить отдельно. Снимок Manager тоже не заменяет полную резервную копию окружения.
AUTOMATIC1111 / Forge — UI с вкладками
AUTOMATIC1111 — веб-интерфейс с вкладками txt2img, img2img, inpaint и extensions. Он удобен для поддерживаемых моделей и старых проектов, но совместимость каждого нового checkpoint проверяют отдельно.
Forge — отдельный проект с похожей формой интерфейса и собственным backend. Производительность и совместимость сравнивают на одной модели и workflow.
Плюсы:
- Понятный UI с первого взгляда: поле для промпта, кнопка Generate.
- Расширения для шаблонов промптов, подстановок и региональных условий; совместимость проверяется для выбранной версии.
- Простой старт для новичков.
Минусы:
- Поддержка конкретных новых архитектур и расширений зависит от версии интерфейса или форка.
- Сложные разветвлённые процессы труднее увидеть целиком, чем в нодовом графе.
A1111 и Forge подходят тем, кому удобнее работать с формой и вкладками. ComfyUI удобнее там, где важны явные связи между этапами и повторяемость сложного процесса.
Fooocus — интерфейс с минимумом ручных настроек
Fooocus — интерфейс, который скрывает большую часть технических параметров и предлагает готовые настройки поверх SDXL.
Плюсы: меньше ручных настроек перед первым запуском. Минусы: часть внутренних этапов скрыта. Когда важны нестандартные ветвления и точная воспроизводимость, удобнее интерфейс, который показывает весь граф.
Облачные сервисы
Если локального GPU недостаточно, остаются три устойчивых варианта: API с оплатой за запрос, аренда отдельной машины с собственным ComfyUI или готовый веб-сервис. Перед выбором важны не только цена, но и срок хранения файлов, доступ к моделям, ограничения лицензии и возможность выгрузить workflow.
Локальное железо
Для локальной работы важны объём памяти, поддержка нужного backend и доступность подходящих сборок. Большой запас VRAM упрощает работу с тяжёлыми моделями, крупным кадром и несколькими ControlNet. При меньшем объёме могут помочь квантование, перенос части данных в RAM, обработка по плиткам и более лёгкие модели — если выбранная реализация поддерживает эти способы.
На Apple Silicon доступны собственные оптимизации, а на NVIDIA — CUDA-экосистема. Скорость зависит от модели, реализации и объёма памяти. Сравнение имеет смысл при одинаковых условиях, включая перенос данных между RAM и VRAM.
Управление: LoRA, ControlNet, IP-Adapter
Базовой модели иногда достаточно промпта. Если нужно устойчивее сохранять персонажа, задавать позу или переносить признаки референса, можно подключить совместимые дополнительные модули.
LoRA — адаптация под стиль, персонажа или задачу
LoRA (Low-Rank Adaptation) — техника лёгкого дообучения модели. При обычном обучении LoRA исходные веса заморожены, а обучаются небольшие матрицы, задающие поправки к выбранным слоям. Размер файла зависит от ранга, числа слоёв и точности хранения. Число изображений выбирают под задачу: качество и разнообразие набора важнее универсального числа.
Что бывает:
- LoRA на стиль (винтаж, аниме, акварель, киберпанк)
- LoRA на персонажа (узнаваемый герой)
- LoRA на концепцию (определённая поза, определённый тип съёмки)
- LoRA на объект (продукт бренда, локацию)
Небольшую LoRA часто можно обучить на одной мощной потребительской видеокарте или арендованном облачном GPU. Время и стоимость зависят от модели, датасета, разрешения и настроек обучения.
Civitai (civitai.com) — один из крупных каталогов моделей и LoRA. Перед скачиванием важны карточка, лицензия, базовая модель и отзывы о файле.
Сила LoRA задаётся в загрузчике. В AUTOMATIC1111 используется, например, запись <lora:my_style:0.7>, а в ComfyUI — поля соответствующей ноды. Это коэффициент влияния в конкретном загрузчике, а не буквальные «70% стиля». Рабочее значение зависит от адаптера, базовой модели и сочетания с другими LoRA.
Несколько LoRA можно подключить вместе. Их вклад удобно проверять по отдельности: сочетание может менять лицо, фактуру или композицию сильнее, чем каждый адаптер сам по себе.
ControlNet — управление композицией
ControlNet — способ добавить структурное условие: позу, глубину, контуры, сегментацию или другую карту, поддерживаемую конкретной моделью контроля.
Виды:
- OpenPose — задать позу персонажа через схему ключевых точек тела
- Depth Map — задать глубину сцены (где близко, где далеко)
- Canny Edge — задать контуры всей композиции
- Segmentation Map — задать «здесь будет небо, здесь дом, здесь поле»
- Lineart — задать чёрно-белые контуры (для иллюстрации)
- Scribble — нарисовать черновик, модель допишет
- Tile — опора на изображение при детализации и увеличении
Это не универсальные режимы одной модели: для разных условий нужны совместимые модели контроля. InstructPix2Pix, который редактирует картинку по фразе, — отдельный подход; существуют и специальные контрольные модели с похожим назначением.
ControlNet уменьшает случайность в выбранном аспекте композиции, но не делает результат точной копией карты. Для одних задач достаточно prompt и референса, для других структурный контроль действительно становится главным инструментом.
IP-Adapter — референс по картинке
IP-Adapter добавляет условие по референсной картинке. Он использует визуальные признаки, а не карту позы или глубины, поэтому отличается от обычного структурного ControlNet.
Например, к запросу портрета можно приложить старую фотографию как образец атмосферы. Адаптер помогает учесть её цвет и другие признаки, но может перенести и нежелательные детали; влияние зависит от варианта и силы подключения.
Варианты для лиц помогают сохранять узнаваемость по портрету. IP-Adapter Plus Face и FaceID — не одно и то же: они используют разные представления, а некоторые FaceID-варианты требуют дополнительной LoRA. Собственное обучение персонажа может не понадобиться, но точное совпадение лица не гарантировано.
Regional Prompting
Regional Prompting — приём, при котором разные части картинки получают разные промпты. Левая половина — пейзаж, правая — портрет. Верхняя четверть — небо, остальное — город.
Делается через специальные расширения (Regional Prompter в A1111, нативные ноды в ComfyUI).
Полезно для сложных композиций, где простой текст не справляется.
Embeddings и Textual Inversion
Textual Inversion обучает небольшое текстовое представление нового понятия. Это другой механизм, чем LoRA: он легче по числу обучаемых параметров, но по-разному подходит стилям, объектам и конкретным энкодерам.
Hypernetwork — другой механизм адаптации. В экосистеме Stable Diffusion это название используют для небольших сетей, меняющих обработку признаков в attention; их загрузка и совместимость отличаются от LoRA.
Img2img, Inpainting, Outpainting
Stable Diffusion работает не только в режиме «текст → картинка», но и в картинка → картинка через несколько техник.
Img2img — переделать существующее
Img2img — даёте модели исходную картинку и промпт. Она перерисовывает её в нужном направлении.
Параметр Denoising Strength контролирует, насколько глубоко процесс уходит от входного latent. Низкие значения обычно сохраняют больше исходника, высокие дают модели больше свободы. Точная граница зависит от sampler, числа шагов, модели и способа encode, поэтому её находят серией с фиксированным seed.
Применения:
- Стилизация фото
- Доработка плохой генерации
- Перенос концепции через несколько итераций (текст → черновик → детализация → финал)
Inpainting — перерисовать кусок
Inpainting — выделяете маской область для перерисовки. Незатронутые части служат окружением, но точное сохранение их пикселей зависит от реализации. Для строгого совпадения отредактированный фрагмент накладывают на оригинал.
Применения:
- Заменить лицо
- Убрать объект (например, столб на фото)
- Добавить деталь («теперь у этой женщины серьги»)
- Исправить руки/анатомию
Можно использовать специализированную inpaint-модель или обычную модель с подходящей схемой маски. Слишком тесная маска иногда мешает: при замене предмета нужны место для новой формы, тени и плавного перехода. Важны также исходное содержимое области, denoise и согласование границ.
Outpainting — расширить границы
Outpainting — продолжить картинку за её исходные границы.
Применения:
- Превратить 1:1 в 16:9 (для постера или баннера)
- Расширить кадр для широкоэкранного видео
- Добавить фон вокруг центрального объекта
Outpainting часто реализуется как inpainting добавленных областей холста. Модели приходится продолжать перспективу, свет и сюжет за пределами исходника. Насколько это удаётся, зависит от сцены и размера расширения; невидимые детали не восстанавливаются достоверно, а генерируются.
Upscaling и доводка
Если исходного разрешения не хватает, можно добавить увеличение и детализацию.
Upscaler — увеличивает размер картинки (1024 → 2048, 4096, 8192). Используют:
- ESRGAN и модели на близких архитектурах, включая Real-ESRGAN и 4x-UltraSharp, — обученные способы увеличения
- Tile-based upscaling — большую картинку разбивают на тайлы и каждый прогоняют через SD (tile diffusion)
- Topaz Gigapixel — отдельный коммерческий продукт для апскейлинга
- SUPIR — генеративное восстановление изображений на основе SDXL
Face Restoration — отдельная нейросеть для восстановления лиц (CodeFormer, GFPGAN). Это может помочь нечёткому лицу, но инструмент способен изменить внешность и додумать отсутствующие детали. Для реального человека результат стоит сравнить с исходными снимками, а оригинал сохранить.
От картинки к видео
Анимационные модули на базе SD
AnimateDiff и похожие модули добавляют к совместимой модели временные связи. Пайплайн генерирует не отдельные независимые кадры, а последовательность, где движение и детали стараются сохраняться во времени.
Такой подход подходит для коротких движений, лупов и экспериментов с управлением позой. Длина, разрешение и стабильность зависят от motion-модуля, памяти, контекста и базовой модели.
Видеомодели с опубликованными весами
Hunyuan Video (Tencent) — семейство открытых весов для генерации видео. Длина, разрешение, объём весов и требования зависят от конкретной версии и способа запуска.
Wan, LTX-Video и другие открытые семейства решают похожую задачу с разными требованиями к памяти, длительности и управлению. Их сравнивают на одинаковой сцене и готовом workflow, а точную версию фиксируют вместе с проектом.
Закрытые видеосервисы
Runway, Kling и Pika — примеры закрытых сервисов для генерации AI-видео. Их полезнее сравнивать по поддержке референсов, управлению камерой, длительности непрерывного кадра, политике хранения данных, возможности коммерческого использования и итоговой стоимости удачного дубля. Для сравнения полезно учитывать и неудачные попытки: цена одного запуска не равна цене готового кадра.
text-to-video vs image-to-video
Text-to-Video — генерация видео из текстового промпта без заранее заданного кадра.
Image-to-Video — оживление статической картинки. Начальный кадр уже задаёт композицию и внешность объектов, но движение всё равно может нарушить детали.
Image-to-video удобно, когда важен заранее подготовленный первый кадр. Text-to-video оставляет модели больше свободы. В реальном проекте оба подхода могут сочетаться с монтажом и обычной графикой.
С чем не путать
Stable Diffusion ≠ Midjourney. Stable Diffusion — семейство весов и локальных инструментов, а Midjourney — закрытый облачный сервис. Разница прежде всего в контроле над средой, workflow и данными, а не в универсальном месте по качеству или цене.
Stable Diffusion ≠ генератор изображений OpenAI. Это разные продуктовые линии: у Stable Diffusion есть распространяемые веса и локальные интерфейсы, а сервис OpenAI работает через облачные продукты и API.
SD 1.x ≠ SDXL ≠ FLUX. Это разные архитектурные семейства. LoRA и ControlNet совместимы только с той базой, под которую обучены; нужная архитектура указана в карточке дополнения.
Stable Diffusion ≠ Stability AI. Stable Diffusion — название семейства моделей, Stability AI — компания. FLUX выпускает Black Forest Labs и относится к другой линейке, даже если проекты исторически связаны людьми из одной исследовательской команды.
ComfyUI ≠ Stable Diffusion. ComfyUI — это интерфейс и среда выполнения графов. Он поддерживает разные семейства изображений, видео и другие совместимые модели через встроенные и сторонние ноды.
Latent ≠ Pixel. Картинка в latent space — это не то, что видит глаз. Это числовое представление, с которым работают генеративная модель и совместимый VAE. Чтобы увидеть финальную картинку — нужно декодировать через VAE.
Inpainting model ≠ обычная модель. Специализированная модель обучена учитывать маску и видимые части изображения особым способом. Обычная модель тоже может работать с маской в подходящей схеме. Швы и артефакты возможны в обоих случаях.
Частые ошибки и заблуждения
«Закрытые сервисы полностью заменяют локальные модели». Эти подходы решают разные задачи. Облако проще начать использовать, а открытые веса дают локальный запуск, доступ к workflow и возможность настраивать модель. Иногда проект сочетает оба варианта.
«Хорошие картинки — это секретный промпт». Результат складывается из модели, референсов, LoRA, структурного контроля, настроек и постобработки. Один промпт не заменяет весь процесс.
«Чем длиннее промпт — тем лучше». Нет. Результат зависит от того, какие понятия понимает текстовый энкодер и не противоречат ли детали друг другу. Несколько точных признаков сцены обычно полезнее длинной гирлянды усилителей качества.
«Параметры можно не понимать». Готовый preset действительно даёт старт, но знание роли sampler, scheduler, steps и denoise помогает менять результат осмысленно и возвращаться к удачной версии.
«Negative prompt всегда нужен». Нет. В обычном CFG отрицательный текст может занять место пустого опорного условия. Другие схемы его не используют или обрабатывают иначе. Это свойство конкретного pipeline.
«Чем больше LoRA, тем лучше». Несколько адаптеров могут конфликтовать за одни и те же признаки. Рабочую комбинацию ищут по одному изменению за раз, сохраняя seed и остальные параметры.
«Статус AI-изображения одинаков во всех странах». Нет. Авторское право, лицензия модели, права на исходники и правила площадки — разные слои. Для коммерческого проекта их проверяют в нужной юрисдикции и на дату публикации.
«AI либо полностью заменяет художника, либо бесполезен». В реальном процессе генерация может отвечать за поиск вариантов, черновой фон или ретушь, а композицию, отбор, права и финальную подачу держит человек. Граница меняется от проекта к проекту.
Что почитать дальше
Если вы только начинаете:
- Stable Diffusion — что это вообще
- Diffusion-модель — теория
- ComfyUI — нодовый интерфейс для воспроизводимых workflow
- Steps, CFG Scale, Seed — три ключевых параметра
Архитектура:
- VAE — сжимает картинки в латент
- CLIP — кодирует текст и изображения
- Latent Space — где живёт диффузия
- Sampler и Scheduler — алгоритм генерации
Семейство моделей:
- SDXL — ветка Stable Diffusion с двумя текстовыми энкодерами
- FLUX — семейство генеративных моделей Black Forest Labs
- Refiner — доводка деталей
Управление:
- LoRA — стиль и персонаж
- ControlNet — управление композицией
- IP-Adapter — референс по картинке
- OpenPose, Depth Map, Canny Edge — способы получить структурные условия
- Regional Prompting — разные промпты для разных областей
Режимы работы:
- Img2img — переделать существующую
- Inpainting — перерисовать кусок
- Outpainting — расширить границы
- Upscaler — увеличить размер
- Face Restoration — улучшить лицо с риском изменения деталей
- Negative Prompt — чего не должно быть
- Aspect Ratio — соотношение сторон
- Denoising Strength — сила в img2img
Другие сервисы и интерфейсы:
- Midjourney — облачный генератор изображений
- DALL-E — история и особенности семейства OpenAI
- AUTOMATIC1111 — интерфейс с вкладками
Видео:
- Text-to-Video — генерация видео из текста
- Image-to-Video — оживление картинки
- Runway / Kling / Pika — облачные сервисы генерации видео
- Fine-tuning — обучение модели под себя
- DreamBooth — метод персонализации модели
- Trigger Word — слово-активатор для LoRA
- Dataset Captioning — подписи к обучающим картинкам
Технические нюансы:
- Safetensors — формат файлов моделей
- VRAM — память видеокарты
- Custom Nodes — расширения ComfyUI
Большие разборы:
- Что такое нейросеть — устройство нейросетей в целом
- Что такое LLM — про языковые модели
- Как писать промпты — гид по prompt engineering
Или полный каталог словаря: 156 терминов — материалы можно выбирать по темам и связанным понятиям.
Частые вопросы
Что нужно для запуска SD локально?
- Устройство и backend, которые поддерживает выбранная сборка.
- Достаточно RAM/VRAM для точного checkpoint, VAE и размера кадра либо рабочий offload.
- Запас места под веса, кэш и результаты.
- Интерфейс вроде ComfyUI, AUTOMATIC1111 или совместимого форка.
Требования лучше брать из карточки конкретной модели: внутри одного семейства встречаются варианты разного размера и точности.
Что лучше для начинающих — ComfyUI или A1111? A1111/Forge предлагает форму с привычными полями, а ComfyUI — граф из узлов. Первый подход проще для одиночной генерации, второй удобнее для повторяемого многоэтапного процесса. Выбор зависит от сложности workflow, а не от уровня «серьёзности» пользователя.
Где брать модели? Надёжная точка входа — страница разработчика модели и репозиторий, на который она ссылается. В каталогах вроде Hugging Face и Civitai важно проверить автора, базовую архитектуру, лицензию, хеш файла и список необходимых компонентов.
Что лучше — FLUX или SDXL? Это разные архитектуры и экосистемы дополнений. Выбор зависит от нужных LoRA и моделей контроля, лицензии, памяти и поведения на ваших сценах. Сравнивать их полезно на одинаковом наборе задач, а не по общей таблице качества.
Можно ли коммерчески использовать AI-картинки? Зависит от лицензии точной версии модели, условий сервиса, прав на исходные материалы и юрисдикции. Название семейства не гарантирует одинаковых условий для всех checkpoints. Для коммерческого проекта нужна карточка конкретных весов или действующие условия облачного сервиса; при существенном риске — консультация специалиста по нужной стране.
Сколько времени уходит на генерацию? Время определяют модель, разрешение, число шагов, batch size, точность весов, offload и видеокарта. Поэтому полезнее измерить один и тот же workflow на своём компьютере, чем переносить готовую цифру из чужого теста.
Как сделать стиль конкретного фотографа/художника? Сначала стоит определить, какие свойства нужны на самом деле: свет, палитра, фактура, композиция или узнаваемые мотивы. Их можно задать описанием, лицензированными референсами, IP-Adapter либо собственной LoRA на материалах, для которых есть права. Так результат легче контролировать, чем запросом на прямое копирование живого автора.
Почему высокий CFG портит изображение? Слишком высокий CFG может приводить к перенасыщенным цветам и артефактам. Рабочий диапазон зависит от семейства модели, поэтому начальное значение берут из её карточки или готового workflow.
Почему руки получаются плохими? Кисти занимают мало пикселей, имеют много возможных положений и легко перекрываются предметами. Ошибки встречаются в любом семействе, хотя частота различается. Обычно помогает более крупный исходный кадр, точная поза, локальный inpainting и проверка на финальном размере.
Что такое hi-res fix? Hi-res fix — двухпроходный приём: сначала строится композиция в подходящем для модели размере, затем изображение увеличивается и уточняется через img2img с умеренным denoising. Он полезен не для каждой архитектуры и может изменить лицо или мелкие предметы, поэтому результат сравнивают с прямой генерацией нужного размера.
Можно ли заработать на Stable Diffusion? Stable Diffusion используют в иллюстрации, предвизуализации, прототипах, ретуши и подготовке вариантов. Коммерческая ценность появляется не из самой кнопки генерации, а из решённой задачи, редакторского качества и понятных прав на модель, дополнения и исходные материалы.
Универсальной «финальной сборки» здесь нет. Её проще собрать слоями:
- Оборудование: достаточно памяти для выбранной модели, точности и размера кадра.
- Интерфейс: ComfyUI со встроенным Manager или интерфейс с формой, если граф не нужен.
- Базовая модель: вариант, совместимый с нужными LoRA, ControlNet и лицензией проекта.
- Управление сценой: только те модули контроля, которые действительно улучшают повторяемость.
- Апскейл и ретушь: отдельный проверяемый этап, а не обязательная марка программы.
- Видео: модель и способ запуска под нужную длительность, движение и бюджет вычислений.
Главное
Stable Diffusion сделала локальную генерацию изображений массово доступной и стала основой большой экосистемы моделей, LoRA и интерфейсов. Она продолжает использоваться рядом с другими открытыми семействами и облачными сервисами.
Основные принципы:
- Stable Diffusion — семейство, а не одна модель. У поколений различаются разрешение, архитектура, лицензия и совместимые дополнения.
- Условия решают разные задачи. Prompt описывает сцену, а LoRA, ControlNet и IP-Adapter помогают управлять разными свойствами.
- Интерфейс определяет форму работы. ComfyUI удобен для графов и воспроизводимости, формы — для быстрых одиночных запусков.
- Параметры связаны между собой. Steps, CFG, sampler и scheduler сравниваются при одинаковых остальных условиях.
- Лицензия относится к точному файлу. У базовой модели, LoRA, контрольного модуля и сервиса могут быть разные условия.
Первые результаты редко показывают предел модели или автора. Стабильность появляется, когда сохраняются удачные workflow, меняется по одному параметру за раз и остаётся понятный набор тестовых сцен.
Связанные понятия собраны в словаре. Короткие повторяемые сравнения с одним изменённым параметром помогают увидеть, за какую часть изображения отвечает каждая настройка.
Источники
- High-Resolution Image Synthesis with Latent Diffusion Models — латентная диффузия.
- Scaling Rectified Flow Transformers for High-Resolution Image Synthesis — подход SD 3.
- Карточка SDXL Base 1.0 — компоненты и ограничения конкретной модели.
- IP-Adapter: официальный репозиторий — варианты адаптера и работа с референсами.
- ComfyUI: KSampler — параметры сэмплирования.
- ComfyUI: пример с LoRA — подключение адаптера.
Подписка Neurosaver
Получать новые разборы Neurosaver
Большие материалы выходят не каждый день, зато их стоит читать спокойно. Подпишитесь, и мы пришлём новые разборы и важные обновления словаря.