Aspect Ratio

aspect ratio — соотношение ширины и высоты картинки

Раздел
Параметры
Сокращ.
AR
Обновлено
19.06.26

Aspect Ratio (соотношение сторон) — пропорция между шириной и высотой результата генерации. Самые частые: 1:1 (квадрат, соцсети), 16:9 (видео, обложки), 9:16 (вертикали), 4:3 (классическое фото). У SDXL и FLUX есть список «родных» разрешений, на которых модель обучалась — выход за пределы даёт артефакты. В Stable Diffusion 1.5 безопасно только 512×512 и 768×768. В Midjourney задаётся флагом `--ar 16:9`, в ComfyUI — параметрами Empty Latent Image.

Коротко

Коротко. Aspect Ratio — пропорция ширины к высоте кадра. Главные форматы: 1:1 (соцсети, аватарка), 16:9 (видео, обложки), 9:16 (Stories, Reels), 4:3 (классика), 21:9 (кино). У каждой диффузионной модели есть список «родных» разрешений — выходить за них опасно: на SD 1.5 ниже 512 модель не учится, на 1024×1024 ломается. SDXL и FLUX обучались на множестве форматов и работают шире.

Что это такое

Январь 2023-го. Дизайнер генерирует обложку для YouTube. Запрашивает 1920×1080 (16:9) в SD 1.5. Получает «склеенный» кадр: композиция распадается на две половины, лицо повторяется, фон — как будто два разных мира.

Причина — SD 1.5 училась почти только на 512×512. Любое другое разрешение для неё — выход за зону знаний. SDXL уже умеет десятки соотношений, потому что Stability AI намеренно тренировала её на разных форматах.

В диффузии Aspect Ratio — не просто «растянуть холст». Это указание модели, какой латент создавать. Латент 64×64 даёт квадрат 512×512. 128×64 — горизонтальный 1024×512. 64×128 — вертикальный. И каждый из этих форматов нужно было увидеть на тренировке.

Главные форматы в 2026 году:

  • 1:1 (1024×1024 для SDXL) — соцсети, аватарки, продуктовые карточки.
  • 16:9 (1344×768) — видео, обложки YouTube, кино-кадры.
  • 9:16 (768×1344) — Stories, Reels, TikTok.
  • 4:3 (1152×896) — классическое фото, презентации.
  • 3:4 (896×1152) — портреты, плакаты.
  • 21:9 (1536×640) — кино-формат, anamorphic.

Как это работает

В Stable Diffusion и подобных моделях aspect ratio задаётся через размер латента, который потом VAE распаковывает в картинку. Для SDXL латент 128×128 → 1024×1024 картинка. Латент 168×96 → 1344×768 (16:9) картинка.

Латент должен быть кратен 8 (или 16) — это требование архитектуры U-Net. Поэтому нельзя поставить ровно 1080: округляется до 1088 или 1072.

Каждая модель имеет свой набор «родных» разрешений:

  • SD 1.5 — 512×512 (главное), 768×768, иногда 512×768.
  • SDXL — 1024×1024 и 8 других стандартных соотношений.
  • SD 3.5 — гибкая, около 1024×1024.
  • FLUX — от 512×512 до 1536×1536 на разных AR.

При генерации в формате, на котором модель не обучалась, возможны:

  • Дублирование композиции (две головы в широком кадре SD 1.5).
  • «Растяжение» объектов.
  • Артефакты по краям.
  • Композиция «расплывается» в углах.

Пример на практике

Дизайнер делает рекламную кампанию для бренда: одинаковый персонаж на разных форматах.

  • Инстаграм-пост — 1:1 (1024×1024).
  • Stories — 9:16 (768×1344).
  • YouTube-обложка — 16:9 (1344×768).
  • Постер для печати — 3:4 (896×1152).

В SDXL Juggernaut он генерирует каждый формат отдельно, с одним и тем же seed и промптом. Стиль и лицо персонажа сохраняются. Каждый AR — родной для модели, поэтому композиция держится хорошо.

В SD 1.5 та же задача потребовала бы вспомогательных трюков: генерация на 512, потом hi-res fix с правильным AR, потом upscale. Втрое больше времени.

Альтернатива — Midjourney: пишет один промпт и в конце добавляет флаги --ar 1:1, --ar 9:16, --ar 16:9. Каждая команда выдаёт нужный формат.

С чем часто путают

  • Aspect Ratio и Resolution — AR это пропорция (16:9), Resolution — конкретные числа (1920×1080). Один и тот же AR может быть в разных разрешениях.
  • Aspect Ratio и Hi-Res Fix — Hi-Res Fix — техника апскейла после генерации, не AR. Часто используют вместе: сначала родной AR, потом Hi-Res.
  • Aspect Ratio и Bucketing — bucketing это техника тренировки (разбить датасет по AR-корзинам). AR — параметр генерации. Bucketing влияет на то, какие AR модель «знает».
  • Aspect Ratio в SD и в Midjourney — функционально то же, синтаксис разный. SD: width/height в пикселях. Midjourney: --ar 16:9 строкой.

Частые ошибки и заблуждения

  • «Можно ставить любое разрешение». На SD 1.5 — нельзя. Выход за 512/768 даёт артефакты. На SDXL и FLUX свободы больше, но всё равно лучше держаться «родных» AR.
  • «4K сразу из модели». Нет. SDXL рисует ~1024×1024, FLUX до 1536. Дальше нужны upscaler (RealESRGAN, SUPIR). Прямая генерация в 4K даёт мусор.
  • «AR не влияет на VRAM». Влияет линейно: 1024×1024 ест в 4 раза больше VRAM, чем 512×512. На крайних AR (например 1536×640) расход умеренный.
  • «1024×1024 быстрее, чем 1024×1536». Нет, ровно пропорционально. 1024×1536 в 1.5 раза дольше, чем 1024×1024.
  • «Соцсети требуют точного 1080×1080». Чаще нет: они принимают любое 1:1 и сами кадрируют. Точные размеры важны только для печати и фотобанков.

Связанные термины

  • Resolution — конкретные размеры в пикселях.
  • Latent Space — пространство, в котором задаётся размер.
  • Upscaler — повышение разрешения после генерации.
  • Hi-Res Fix — техника двухступенчатого апскейла в SD.
  • Bucketing — техника тренировки модели на разных AR.
  • Empty Latent Image — узел ComfyUI, где задаётся размер.

Частые вопросы

Какие AR поддерживает SDXL? Главные «родные»: 1024×1024 (1:1), 1152×896 (4:3), 896×1152 (3:4), 1216×832 (3:2), 832×1216 (2:3), 1344×768 (16:9), 768×1344 (9:16), 1536×640 (21:9), 640×1536 (9:21).

Можно ли задать AR не из списка? Да, SDXL и FLUX переносят это спокойно. Главное — числа должны делиться на 8 (или 16 для FLUX). Но качество чуть хуже на «чужих» AR.

Как задать AR в Midjourney? Флагом в конце промпта: --ar 16:9. Поддерживаются 1:1, 16:9, 9:16, 4:3, 3:4, 21:9, 9:21, 2:3, 3:2.

Что такое 21:9 в SDXL? Кино-формат (anamorphic). Размер 1536×640. Хорош для пейзажей, кино-кадров, скриншотов. SDXL умеет это родно, FLUX тоже.

Влияет ли AR на время генерации? Да, пропорционально общей площади. 1024×1024 и 1344×768 близки по времени (площадь ~1 млн пикселей). 1536×1536 — в 2.25 раза дольше.

Почему SD 1.5 ломается на 1024×1024? Модель тренировалась только на 512. Латент 128×128 для неё «выходит за пределы тренировочных данных» — модель пытается покрыть его, но дублирует элементы. Решение — Hi-Res Fix или переход на SDXL/FLUX.

Главное

Aspect Ratio — базовый параметр генерации, но на разных моделях работает по-разному. На SD 1.5 держитесь 512 и 768. На SDXL и FLUX выбирайте из списка родных AR — модели тренировались на них специально. Под коммерческие задачи держите шпаргалку под своей моделью: 1:1 для соцсетей, 16:9 для видео, 9:16 для Stories, 3:4 для постеров. Для разрешений выше «родных» используйте Upscaler.