Depth Map

depth map — карта глубины как управление пространством сцены

Раздел
Адаптеры
Обновлено
18.05.26

Depth Map — чёрно-белое изображение, где яркость каждого пикселя означает расстояние до камеры: ближе — светлее, дальше — темнее. В Stable Diffusion через ControlNet Depth используется для контроля **3D-композиции**: где передний план, где фон, как объекты расположены в пространстве. Главный инструмент переноса композиции с одного кадра на другой без жёсткого копирования контуров.

Коротко

Коротко. Depth Map — это чёрно-белая «карта глубины»: ближе к камере — светлее, дальше — темнее. В Stable Diffusion через ControlNet Depth она задаёт 3D-структуру кадра: какие объекты на переднем плане, какие на заднем, как они расположены в пространстве. Самый частый сценарий: «нарисуй другую сцену, но с такой же композицией». Препроцессоры в 2026: MiDaS, ZoeDepth, Depth-Anything-V2 — последний на голову точнее.

Что это такое

Архитектор подбирает варианты для рендера интерьера. У него есть исходный 3D-набросок — простая модель из SketchUp, серая болванка комнаты с мебелью. Хочет получить 5 разных интерьеров: японский минимализм, скандинавский, лофт, ар-деко, бруталистский. Композиция должна остаться той же.

Если просто прогнать через Stable Diffusion с разными промптами — каждый раз будет своя комната. Кресло переедет, окна сместятся, стены поменяются.

С Depth Map: 3D-сцена прогоняется через MiDaS-препроцессор. Получается чёрно-белая карта: окна тёмные (далеко), кресло на переднем плане светлое, диван средне-серый. Эта карта подаётся в ControlNet Depth + новый промпт. На выходе — комната с японским минимализмом, с тем же расположением мебели и окон.

В отличие от OpenPose, который держит позу, Depth держит трёхмерную структуру всей сцены. Где у вас была глубина — там она и останется. Стол не залезет в окно, диван не растворится в стене.

К 2026-му главные препроцессоры:

  • MiDaS — оригинал 2019-го, всё ещё стандарт в коробке.
  • ZoeDepth — точнее на абсолютных расстояниях.
  • Depth-Anything-V2 — лучшее качество, особенно на отражениях, прозрачных объектах, тонких структурах.

Как это работает

Depth-препроцессор — это отдельная нейросеть. Не Stable Diffusion, а монокулярная depth estimation модель, обученная угадывать глубину по одному изображению (без стерео-камеры или LiDAR'а). Принцип:

  1. Препроцессор анализирует фото. Использует контекст: размер знакомых объектов, перекрытия, тени, перспективу.
  2. Выход: карта той же ширины и высоты, что и входное изображение. В каждом пикселе — оценка расстояния, нормализованная в диапазон 0..1 и переведённая в яркость.
  3. ControlNet Depth модель получает эту карту и направляет диффузию: близкие зоны рисуются крупнее и в фокусе, дальние — мельче и размытее.

Что хорошо считывает Depth-препроцессор:

  • Размещение объектов в пространстве (передний/задний план).
  • Перспективу комнат и улиц.
  • Складки одежды и объём фигур.
  • Лестницы, мосты, вытянутые сцены.

Что хуже:

  • Отражения в зеркалах (V2 справляется лучше).
  • Прозрачные стёкла.
  • Сложные перекрытия с похожей текстурой.
  • Сцены без явных глубинных подсказок (ровный текст, абстрактные узоры).

Пример на практике

Дизайнер работает над концептом для VR-проекта. Главное помещение — лаборатория алхимика: высокие потолки, стол посередине, шкафы по стенам, мансардное окно сверху.

Делает грубую 3D-модель в Blender за 15 минут (всё серое, без текстур). Рендерит из нужной точки. Скармливает в ComfyUI:

Load Image → Depth Anything V2 Preprocessor →
Apply ControlNet Depth (strength 0.8) → KSampler

Промпт: dark alchemist laboratory, glowing potions, crystal lamps, dust in light beams, cinematic.

Один рендер 3D + Depth → 8 разных вариантов лаборатории. Все — с одной композицией: стол в центре, шкафы на местах, лучи света через окно. Меняется только наполнение, стиль, освещение, мелочи.

В FLUX есть нативная поддержка Depth ControlNet через Union или специализированные модели. Качество высокое, особенно на сложных архитектурных сценах.

С чем часто путают

  • Depth Map и Normal Map — Depth даёт расстояние до камеры. Normal — направление поверхности (куда «смотрит» каждая точка). Normal используется в 3D-движках, в SD редко.
  • Depth и OpenPose — Depth держит композицию сцены, OpenPose — позу человека. Часто комбинируют: Depth для интерьера + OpenPose для фигуры внутри.
  • Depth и Z-buffer (3D) — в 3D-движках Z-buffer хранит точные расстояния от камеры. Depth Map в SD — это оценка, основанная на одном изображении, не точное измерение.
  • MiDaS и ZoeDepth и Depth-Anything — все три делают depth-карту, но разными моделями и с разной точностью. Depth-Anything-V2 в 2026 — лучший выбор по умолчанию.
  • Relative Depth и Metric Depth — Relative показывает «А ближе, чем Б». Metric (ZoeDepth) пытается сказать абсолютное расстояние в метрах. В SD используется Relative.

Частые ошибки и заблуждения

  • «Depth Map гарантирует одинаковую сцену». Не гарантирует. Управляет глубиной, но детали (текстуры, материалы, цвет) генерируются заново. Композиция стабильна, наполнение — нет.
  • «Чем светлее карта, тем ближе объект». Это договорённость. В большинстве реализаций (MiDaS, Depth-Anything) — да: ближе = светлее. Но есть варианты с обратной шкалой; всегда проверять.
  • «Depth работает только с реалистичными фотографиями». Работает с чем угодно: рисунки, 3D-наброски, чертежи. Главное — наличие глубинных подсказок в изображении.
  • «Depth ControlNet даёт точные пропорции в метрах». Нет, это relative depth. Если нужны точные размеры — лучше брать ZoeDepth и калибровать вручную.
  • «Не нужен препроцессор, можно сразу свою карту». Можно! Если у вас уже есть depth-карта (из 3D-движка, Photoshop, ручной), её можно подать напрямую в ControlNet, минуя препроцессор.

Связанные термины

  • ControlNet — общий механизм, частью которого является Depth.
  • OpenPose — комплементарный контроль позы.
  • Canny Edge — комплементарный контроль контуров.
  • Segmentation Map — другой подход к структуре сцены.
  • Normal Map — родственный концепт из 3D-графики.
  • MiDaS / ZoeDepth / Depth-Anything — модели препроцессоров.
  • IP-Adapter — для переноса стиля, не композиции.

Частые вопросы

Какой препроцессор лучше выбрать? В 2026-м — Depth Anything V2. Он точнее MiDaS на 30–40% и почти не уступает ZoeDepth по абсолютным расстояниям. По умолчанию хороший выбор.

Можно ли получить depth-карту из видео? Да. ComfyUI и AnimateDiff умеют обрабатывать видео покадрово. Также есть специальные модели Video Depth, дающие temporal-стабильную карту.

Depth работает с FLUX? Да. ControlNet Depth для FLUX доступен через Union ControlNet (InstantX), X-Labs или Mistoline. По качеству близко к SDXL.

Что такое «inverse depth»? Перевёрнутая шкала: ближе — темнее, дальше — светлее. Иногда используется в академических работах. Большинство SD-моделей ожидают «нормальную» шкалу (ближе = светлее).

Как комбинировать Depth с другим ControlNet? В ComfyUI — последовательно: Apply ControlNet (Depth) → Apply ControlNet (Canny) → KSampler. В AUTOMATIC1111 — несколько вкладок ControlNet (Multi-ControlNet, по умолчанию доступно).

Можно ли нарисовать depth-карту вручную? Можно, но кропотливо. В Photoshop: чёрный фон → серым закрасить средние объекты → белым передний план. Применить Gaussian Blur 5–10 px для плавности. Подать в ControlNet.

Главное

Depth Map — это карта глубины кадра в чёрно-белом виде, где яркость = близость к камере. В Stable Diffusion через ControlNet Depth она удерживает 3D-композицию: расстановку объектов, перспективу, объём. Стандартный сценарий: один эскиз сцены → много вариантов в разных стилях с одной композицией. Препроцессоры в 2026 — Depth-Anything-V2 (лучший по качеству), MiDaS (классика), ZoeDepth (для метрических расстояний). В сочетании с Canny Edge даёт почти полный контроль архитектуры. Главное преимущество перед другими ControlNet — реальный 3D-контроль вместо плоского обводного.