SDXL

stable diffusion xl — большая версия SD с нативным 1024×1024

Раздел
Генеративные модели
Сокращ.
Stable Diffusion XL
Обновлено
19.06.26

SDXL (Stable Diffusion XL) — увеличенная версия Stable Diffusion от Stability AI, выпущенная в июле 2023 года. По параметрам в три раза больше SD 1.5 — 2.6 миллиарда против 860 миллионов. Тренировалась на нативном разрешении 1024×1024, лучше держит композицию и читает длинные промпты. К 2026 году остаётся самой используемой версией Stable Diffusion: на ней построены Juggernaut XL, RealVisXL, Pony Diffusion и почти все коммерческие тюнинги.

Коротко

Коротко. SDXL — большая версия Stable Diffusion с тремя ключевыми отличиями от SD 1.5: 2.6 миллиарда параметров вместо 860 миллионов, нативное 1024×1024 вместо 512×512, и два текстовых энкодера вместо одного. На практике это значит чище композицию, лучше понимание длинных промптов и качество, сопоставимое с Midjourney v5. В 2026 году — рабочая лошадь open-source генерации.

Что это такое

Июль 2023-го. Stability AI выпускает SDXL 1.0, и сообщество разделяется. Половина радуется качеству: модель впервые делает 1024×1024 без артефактов, лучше держит лица и руки. Вторая половина ворчит: «нужна видеокарта 12 ГБ», «база скучная», «промпты как в SD 1.5 не работают».

Через полгода ворчание затихает. RealVisXL делает SDXL-фотореалистом, Juggernaut XL даёт универсальную базу под кино-постеры, Pony Diffusion XL покрывает аниме. К концу 2024-го SDXL обогнала SD 1.5 по числу скачиваний на CivitAI и стала стандартом по умолчанию.

В 2026-м у SDXL три разновидности:

  • SDXL Base 1.0 — основа, 6.6 ГБ. Иногда используют связку Base + Refiner для дополнительной полировки финала.
  • SDXL Turbo (ноябрь 2023) — ускоренная версия, 1–4 шага вместо 28. Качество чуть хуже, скорость в 7–10 раз выше.
  • SDXL Lightning (февраль 2024, ByteDance) — конкурент Turbo, 2–8 шагов с очень близким к базе качеством.

Все три формата работают с одним семейством LoRA и ControlNet'ов, поэтому переход между ними безболезненный.

Как это работает

Главное отличие от SD 1.5 — внутренние компоненты в два-три раза больше. U-Net (главная нейросеть, которая «убирает шум») вырос с 860M параметров до 2.6 миллиардов. Текстовый энкодер тоже изменился: вместо одного CLIP теперь два — OpenCLIP ViT-G и CLIP ViT-L. Их эмбеддинги склеиваются, и модель получает «более объёмное» понимание промпта.

Технически процесс генерации тот же, что и в любой диффузионной модели:

  1. Текст → эмбеддинг через два CLIP параллельно.
  2. Шум → латент 128×128×4 (для разрешения 1024×1024 — в 4 раза больше, чем 64×64 в SD 1.5).
  3. U-Net убирает шум за 20–30 шагов с помощью sampler и scheduler.
  4. VAE декодирует латент в финальную картинку 1024×1024.

При сохранении формата 1024×1024 латент весит 64 КБ, картинка — около 1 МБ в PNG. Если попросить SDXL генерировать 512×512 — она будет рисовать хуже, чем SD 1.5: вне «своего» разрешения качество падает.

Пример на практике

Дизайнер делает 30 баннеров для рекламной кампании. Формат — 1024×1536 (3:2 вертикально), сцены разные: «офис в дожде», «кофейня вечером», «горный пейзаж».

Без SDXL ему пришлось бы рисовать в SD 1.5 на 512×768, потом дважды апскейлить до 2048×3072, и каждый раз сглаживать руками. На SDXL — генерирует сразу в 1024×1536 через ComfyUI с моделью Juggernaut XL. Sampler DPM++ 2M Karras, 28 шагов, CFG 6, время на кадр — 12 секунд на RTX 4070.

30 кадров готовы за 8 минут. Качество достаточно для печати без апскейла. Лица и руки — без артефактов. Композиция держит «правило третей» из промпта.

Если бы кампания была срочная — он бы взял SDXL Lightning с 6 шагами вместо 28. Время на кадр — 3 секунды. Чуть менее детализированный результат, но для социальных сетей этого хватает.

С чем часто путают

  • SDXL и SD 3 / 3.5 — разные архитектуры. SDXL построен на классическом U-Net, SD 3 и 3.5 на новой MMDiT. Веса не взаимозаменяемы, лицензии разные. SDXL свободнее, SD 3.5 качественнее.
  • SDXL Base и SDXL Refiner — Base делает основную картинку, Refiner добавляет полировку финальных 2–3 шагов. Refiner необязателен — современные тюнинги вроде Juggernaut XL обходятся без него.
  • SDXL Turbo и SDXL Lightning — оба ускоряют генерацию, но обучены по-разному. Turbo от Stability AI через Adversarial Diffusion Distillation, Lightning от ByteDance через прогрессивную дистилляцию. Lightning часто чуть лучше держит детали.
  • SDXL и LoRA для SDXL — LoRA, обученная на SD 1.5, не работает в SDXL. И наоборот. При переходе нужно искать или тренировать заново.

Частые ошибки и заблуждения

  • «SDXL медленнее SD 1.5». На том же железе с 28 шагами — да, в 2–3 раза. Но если сравнивать «SDXL Turbo с 4 шагами» vs «SD 1.5 с 25 шагами» — SDXL Turbo быстрее и качественнее одновременно.
  • «SDXL хуже рисует аниме, чем SD 1.5». Базовая SDXL действительно слабее SD 1.5 в аниме. Но Pony Diffusion XL и Animagine XL полностью закрыли этот разрыв.
  • «Промпт из SD 1.5 работает в SDXL так же». Не работает. SDXL лучше понимает естественный язык, хуже — «утяжелённые» промпты с десятком (((boost))) и kerning'ов. Часто помогает переписать промпт прозой.
  • «Refiner всегда улучшает результат». Не всегда. На пейзажах и абстрактных сценах Refiner помогает, на лицах часто «глаженит» кожу и убирает текстуру. Современные тюнинги обходятся без него.
  • «SDXL заменяет ControlNet и LoRA». Нет. Базовая модель чище SD 1.5, но и в SDXL для жёсткого контроля позы, лица или стиля нужны те же инструменты.

Связанные термины

  • Stable Diffusion — родительская семья, к которой относится SDXL.
  • SD 1.5 — предыдущее поколение, остаётся актуальным для лёгких задач.
  • FLUX — следующая по качеству open-source модель (2024).
  • Refiner — опциональная модель-полировщик для финальных шагов SDXL Base.
  • LoRA — адаптеры для тонкой настройки SDXL.
  • ControlNet — модуль контроля композиции, есть отдельная версия под SDXL.
  • ComfyUI — основной интерфейс для запуска SDXL и работы с её пайплайном.
  • Sampler / Scheduler — алгоритм и расписание шумоподавления.

Частые вопросы

Какой тюнинг SDXL выбрать? Для фотореализма — RealVisXL, Juggernaut XL. Для кино-постеров — Juggernaut XL Lightning. Для аниме — Pony Diffusion XL или Animagine XL. Для иллюстраций — DreamShaper XL. Большинство тюнингов работает с одним и тем же набором LoRA.

Сколько VRAM нужно для SDXL? Минимум — 8 ГБ с оптимизациями (sequential CPU offload, fp8). Комфортно — 12 ГБ. С ControlNet и адаптерами — 16 ГБ. На 6 ГБ запустится, но придётся жертвовать разрешением или скоростью.

В чём разница между SDXL Base и Lightning? Base даёт лучшее качество за 25–30 шагов. Lightning близок по качеству, но укладывается в 4–8 шагов. Lightning удобен для пайплайнов с большим числом кадров (анимация, AB-тест).

Можно ли использовать SDXL коммерчески? Да, лицензия CreativeML Open RAIL++ разрешает коммерческое использование. Это одна из причин, почему SDXL держит первенство — у SD 3 и 3.5 лицензия строже.

Зачем SDXL два разных CLIP? OpenCLIP ViT-G даёт «глубокое» понимание промпта, CLIP ViT-L — «детальное». Их эмбеддинги склеиваются для более точного следования промпту. На уровне пользователя это незаметно, но именно это даёт SDXL преимущество в длинных промптах.

Главное

SDXL — рабочая база open-source генерации в 2026 году. Берите её, если нужна универсальная модель с хорошим балансом скорости и качества: тюнингов под любой стиль много, экосистема LoRA развита, ControlNet работает стабильно. Для максимума качества — пробуйте SD 3.5 или FLUX, для лёгких локальных задач — оставайтесь на SD 1.5. SDXL — золотая середина.