Aspect Ratio

aspect ratio — соотношение ширины и высоты изображения

Раздел
Параметры
Сокращ.
AR
Обновлено
11.08.26

Aspect Ratio описывает форму кадра как отношение ширины к высоте. Оно влияет на композицию и на то, насколько размер близок к обучающему диапазону модели. Пропорция не равна разрешению: один и тот же AR можно получить множеством пар ширины и высоты.

Коротко

Коротко. 16:9 означает, что на каждые 16 условных единиц ширины приходится 9 единиц высоты. Aspect ratio задаёт форму холста, а resolution — число пикселей. В генеративной модели изменение формы меняет не только кадрирование, но и расположение объектов.

Как читать соотношение сторон

AR записывается как ширина:высота. Отношение можно сократить:

1920:1080 = 16:9
1080:1080 = 1:1
1080:1350 = 4:5

Квадрат, вертикаль и широкий кадр направляют взгляд по-разному. В вертикали модель чаще строит фигуру по высоте, в широком кадре получает больше места для окружения. Это композиционное условие, а не растяжение готовой картинки.

Aspect Ratio и resolution

Соотношение 16:9 ничего не говорит о детализации само по себе. И 1280 × 720, и 1920 × 1080 имеют одинаковую форму, но разное число пикселей.

Для вычисления отношения ширину и высоту делят на общий делитель. Для вычислительной нагрузки важна площадь:

площадь = ширина × высота

Два кадра с разными пропорциями могут иметь близкую площадь и похожий расход памяти.

Почему форма влияет на генерацию

Диффузионная модель создаёт latent нужной формы. У широкого latent больше позиций по горизонтали, у вертикального — по вертикали. Attention и свёрточные слои распределяют объекты по этому пространству.

Модель также учится на распределении размеров из датасета. Если заданный холст сильно выходит за знакомую площадь или пропорцию, могут появиться:

  • повторяющиеся персонажи;
  • распавшаяся сцена;
  • обрезанные конечности;
  • растянутый фон;
  • несколько конкурирующих центров композиции.

Точная граница зависит от архитектуры и checkpoint. Универсального списка безопасных размеров для всего семейства нет.

Обучающие buckets

При bucketed training изображения группируются по похожим размерам и соотношениям сторон. Это позволяет обучать модель на вертикальных и горизонтальных кадрах без простого растягивания всего датасета в квадрат.

Карточка модели или тренировочная конфигурация может перечислять использованные buckets. Если таких данных нет, рабочий диапазон находят серией тестов с одинаковыми prompt и seed.

Наглядный пример

Для одной статьи нужны три версии иллюстрации:

  • квадратная карточка;
  • широкая обложка;
  • вертикальная история.

Прямое кадрирование квадрата обрежет героя или подпись. Поэтому дизайнер заранее задаёт три холста и меняет композиционное указание: в широком варианте оставляет место сбоку, в вертикальном — сверху и снизу.

Важные элементы держатся внутри безопасной зоны, потому что интерфейс площадки может добавить собственное кадрирование.

Как выбрать рабочий размер

  1. Определить конечную пропорцию площадки.
  2. Узнать рекомендуемый масштаб конкретной модели.
  3. Выбрать ширину и высоту, которые поддерживает pipeline и которые близки к обучающей площади.
  4. Проверить несколько seed на повтор объектов и обрезание.
  5. После выбора композиции увеличить изображение отдельным этапом, если нужен крупный финал.

Размеры интерфейса площадки и размер генерации не обязаны совпадать. Часто удобнее создать устойчивый кадр в рабочем диапазоне модели, затем аккуратно кадрировать или увеличить.

Aspect Ratio в ComfyUI

В ComfyUI форму начального latent задают ширина и высота соответствующей ноды. Многие архитектуры требуют, чтобы размеры делились на определённый коэффициент из-за устройства VAE и сети.

Preset удобен как старт, но его нужно связывать с моделью, а не с названием ноды. Workflow может хранить список проверенных размеров и пояснение, для какого checkpoint они предназначены.

Обрезка, расширение и генерация заново

Если готовая картинка имеет другую пропорцию, есть три маршрута:

  • Crop убирает часть кадра. Подходит, если вокруг объекта есть запас.
  • Outpainting достраивает края. Полезен, когда нужно сохранить центр и добавить окружение.
  • Новая генерация перестраивает композицию под нужный холст. Часто лучше для сильно отличающегося AR.

Растягивание меняет форму объектов и почти никогда не является хорошим способом адаптации фотографии или иллюстрации.

Текст и интерфейсные элементы

Для обложки важно учитывать не только сюжет, но и место под заголовок, логотип и элементы интерфейса. Генеративная модель не знает точную safe area площадки, если её не заложить в композицию.

Точный текст лучше добавлять после генерации кодом или редактором. Тогда одна иллюстрация легче адаптируется к нескольким форматам.

Частые ошибки

  • Путать AR и число пикселей. 1:1 может быть маленьким или большим квадратом.
  • Генерировать сразу в финальном огромном размере. Площадь может выйти за знакомый диапазон и разрушить сцену.
  • Считать preset универсальным. Checkpoint и ускоренный вариант могут иметь другие рекомендации.
  • Менять пропорцию растягиванием. Объекты деформируются.
  • Оценивать один seed. Некоторые ошибки формы проявляются не на каждом кадре.
  • Забывать safe area. Площадка обрежет важный объект или закроет его интерфейсом.

Частые вопросы

Какой формат лучше для соцсетей?

Требования площадок меняются. Выбирают формат конкретного места публикации и проверяют актуальную safe area перед экспортом.

Почему на широком кадре появляются два человека?

Модель может заполнить непривычно большую ширину повторением знакомого объекта. Помогают меньшая площадь, другой checkpoint, явная композиция или генерация по частям с контролем.

Можно ли сделать 4K прямо в модели?

Технически некоторые pipeline это позволяют, но полезный результат зависит от обучающего масштаба и памяти. Часто надёжнее сначала получить композицию, затем использовать upscale и локальную доработку.

Какие размеры считать родными?

Те, которые указаны авторами точной модели или подтверждены тестом. Название семейства без checkpoint недостаточно.

Главное

Aspect ratio задаёт форму пространства, в котором модель строит сцену. Для устойчивого результата нужны конечный формат, знакомая модели площадь и композиция с запасом под кадрирование. Конкретные числа — свойство модели и площадки, а не вечное правило для всей генерации.