SDXL

stable diffusion xl — семейство латентных диффузионных моделей Stability AI

Раздел
Генеративные модели
Сокращ.
Stable Diffusion XL
Обновлено
11.08.26

SDXL (Stable Diffusion XL) — поколение Stable Diffusion, рассчитанное на изображения примерно мегапиксельного масштаба. Оно использует два текстовых кодировщика, дополнительное условие размера и необязательный refiner. Точные настройки зависят от checkpoint и способа ускорения.

Коротко

Коротко. SDXL — открыто распространяемая архитектурная линия Stable Diffusion для генерации изображений в latent space. По сравнению с SD 1.x у неё крупнее denoiser, два текстовых кодировщика и обучение на больших размерах. Это отдельное семейство: LoRA, ControlNet и VAE должны быть совместимы именно с SDXL.

Что такое SDXL

Stable Diffusion XL была опубликована Stability AI как следующее поколение после SD 1.x и SD 2.x. Исторически базовая версия состоит из двух моделей:

  • Base создаёт композицию и основное изображение;
  • Refiner может принять промежуточный latent и доработать детали на поздней части denoising.

Refiner не обязателен. Многие дообученные checkpoints рассчитаны на полный проход одной моделью, а отдельные workflow используют другой способ детализации.

Что изменилось по сравнению с SD 1.5

Более крупный denoiser

Основная сеть SDXL заметно больше, поэтому лучше моделирует сложные сцены, но требует больше памяти и вычислений. Реальная скорость зависит от реализации, точности, разрешения и устройства.

Два текстовых кодировщика

SDXL соединяет представления двух CLIP-энкодеров. Это даёт более богатое условие для генерации, но не отменяет ограничений: длинный промпт может размыть приоритеты, а точный текст внутри картинки остаётся отдельной сложной задачей.

Условие размера и кадрирования

Модель получает сведения об исходном размере, целевом размере и кадрировании. Эти параметры влияют на композицию и объясняют, почему одинаковый prompt при разных настройках может давать не просто более крупную копию.

Мегапиксельный рабочий масштаб

Обучение SDXL ориентировано примерно на площадь изображения около мегапикселя. Квадрат 1024 × 1024 — известная точка отсчёта, но не единственный допустимый формат. Подходят и другие соотношения сторон с близкой площадью, если их поддерживает workflow.

Как проходит генерация

  1. Промпт кодируется двумя текстовыми энкодерами.
  2. Начальный latent заполняется шумом по seed.
  3. Denoiser шаг за шагом оценивает, какую часть шума убрать с учётом текста и параметров размера.
  4. Sampler и scheduler определяют траекторию этого процесса.
  5. VAE декодирует итоговый latent в пиксели.
  6. При необходимости отдельный refiner, upscaler или inpainting исправляет выбранные области.

Каждый компонент влияет на результат. «SDXL» без названия checkpoint, VAE и workflow описывает только семейство.

Base, fine-tune и LoRA

Base checkpoint удобен как исходная точка и для обучения адаптеров. Fine-tune меняет всё или значительную часть весов под определённый стиль и набор данных. LoRA добавляет компактную адаптацию поверх совместимой основы.

Сторонняя модель с пометкой XL может иметь собственные рекомендации по промпту, CFG, sampler и VAE. Настройки от другой модели не обязаны переноситься без изменений.

Ускоренные варианты

Turbo, Lightning, LCM и другие дистиллированные или ускоренные варианты уменьшают число шагов, но делают это разными способами. Они могут требовать особого scheduler, CFG или LoRA.

Фраза «меньше шагов при том же качестве» слишком грубая. Ускорение меняет характер ошибок и гибкость управления. Кандидаты сравниваются на одинаковых seed, размерах и задачах.

Наглядный пример

Дизайнер готовит вертикальную иллюстрацию для статьи. Он начинает с совместимого SDXL-checkpoint и сохраняет seed.

Сначала проверяет композицию на рабочем размере. Затем меняет только один фактор за раз: prompt, CFG или sampler. Выбранный кадр уточняет inpainting, а увеличение делает отдельным этапом.

Так видно, что именно улучшило результат. Одновременная смена checkpoint, seed и десяти параметров превращает сравнение в лотерею.

SDXL в ComfyUI

Базовый граф включает загрузчик checkpoint, кодирование положительного и отрицательного prompt, latent нужного размера, sampler и VAE Decode. Для refiner нужен второй checkpoint и передача latent на позднюю часть процесса.

Совместимость важнее названия ноды:

  • SDXL LoRA подключается к SDXL-модели;
  • ControlNet должен быть обучен для подходящей архитектуры;
  • refiner получает корректно подготовленный latent;
  • ускоряющий адаптер используется с рекомендованным scheduler;
  • размер изображения выбирается с учётом обучающего распределения.

Встроенный Manager ComfyUI помогает находить и обновлять custom nodes, но не проверяет художественную или архитектурную совместимость workflow автоматически.

Память и скорость

Требования зависят от устройства, backend, точности, размера кадра, batch и числа одновременно загруженных моделей. Offload и tiled VAE помогают уложиться в меньшую память ценой дополнительных передач и времени.

Вместо универсальной таблицы полезнее запустить точный workflow и измерить:

  • пиковую память;
  • время первого и повторного кадра;
  • качество при выбранном размере;
  • влияние refiner и дополнительных сетей.

С чем часто путают

  • SDXL и любой checkpoint с XL в названии. Сторонний fine-tune наследует архитектуру, но меняет поведение.
  • Base и refiner. Это разные этапы; второй не обязателен.
  • Native 1024 и строгий квадрат. Речь о рабочем масштабе, а не об одном формате.
  • Ускорение и обычный checkpoint с малым числом шагов. Дистиллированная модель обучена для такого режима, базовая — не обязательно.
  • Большее разрешение и больше деталей. Слишком крупный latent может разрушить композицию или повторить объекты.

Частые ошибки

  • Подключать LoRA или ControlNet от другой архитектуры.
  • Переносить preset Base на Turbo или Lightning без проверки.
  • Использовать случайный VAE только ради более насыщенных цветов.
  • Считать refiner обязательным для любого изображения.
  • Сразу генерировать финальный огромный кадр вместо отдельного upscale.
  • Оценивать модель по одному удачному seed.

Частые вопросы

SDXL всё ещё имеет смысл использовать?

Да, если подходят доступные checkpoints, адаптеры, лицензия и инфраструктура. Возраст архитектуры сам по себе не определяет пользу.

Нужен ли refiner?

Только если он улучшает конкретный checkpoint и workflow. Это проверяется парным сравнением, а не названием модели.

Какое разрешение выбрать?

Начать с размеров, близких к мегапиксельному обучающему масштабу и нужному соотношению сторон. Точные значения лучше взять из карточки checkpoint и проверить на серии seed.

Почему настройки из чужого workflow не работают?

Могут отличаться checkpoint, VAE, sampler, scheduler, версия custom node и способ кодирования prompt. Для воспроизводимости нужны все эти данные.

Главное

SDXL — не один художественный стиль, а совместимая экосистема базовых моделей, fine-tunes и адаптеров. Её сильная сторона — зрелые локальные workflow и широкий контроль. Хороший результат начинается с совместимых компонентов и измеримого сравнения, а не с универсального набора «магических» параметров.