Depth Map
depth map — карта глубины как управление пространством сцены
Depth Map — чёрно-белое изображение, где яркость каждого пикселя означает расстояние до камеры: ближе — светлее, дальше — темнее. В Stable Diffusion через ControlNet Depth используется для контроля **3D-композиции**: где передний план, где фон, как объекты расположены в пространстве. Главный инструмент переноса композиции с одного кадра на другой без жёсткого копирования контуров.
Коротко
Коротко. Depth Map — это чёрно-белая «карта глубины»: ближе к камере — светлее, дальше — темнее. В Stable Diffusion через ControlNet Depth она задаёт 3D-структуру кадра: какие объекты на переднем плане, какие на заднем, как они расположены в пространстве. Самый частый сценарий: «нарисуй другую сцену, но с такой же композицией». Препроцессоры в 2026: MiDaS, ZoeDepth, Depth-Anything-V2 — последний на голову точнее.
Что это такое
Архитектор подбирает варианты для рендера интерьера. У него есть исходный 3D-набросок — простая модель из SketchUp, серая болванка комнаты с мебелью. Хочет получить 5 разных интерьеров: японский минимализм, скандинавский, лофт, ар-деко, бруталистский. Композиция должна остаться той же.
Если просто прогнать через Stable Diffusion с разными промптами — каждый раз будет своя комната. Кресло переедет, окна сместятся, стены поменяются.
С Depth Map: 3D-сцена прогоняется через MiDaS-препроцессор. Получается чёрно-белая карта: окна тёмные (далеко), кресло на переднем плане светлое, диван средне-серый. Эта карта подаётся в ControlNet Depth + новый промпт. На выходе — комната с японским минимализмом, с тем же расположением мебели и окон.
В отличие от OpenPose, который держит позу, Depth держит трёхмерную структуру всей сцены. Где у вас была глубина — там она и останется. Стол не залезет в окно, диван не растворится в стене.
К 2026-му главные препроцессоры:
- MiDaS — оригинал 2019-го, всё ещё стандарт в коробке.
- ZoeDepth — точнее на абсолютных расстояниях.
- Depth-Anything-V2 — лучшее качество, особенно на отражениях, прозрачных объектах, тонких структурах.
Как это работает
Depth-препроцессор — это отдельная нейросеть. Не Stable Diffusion, а монокулярная depth estimation модель, обученная угадывать глубину по одному изображению (без стерео-камеры или LiDAR'а). Принцип:
- Препроцессор анализирует фото. Использует контекст: размер знакомых объектов, перекрытия, тени, перспективу.
- Выход: карта той же ширины и высоты, что и входное изображение. В каждом пикселе — оценка расстояния, нормализованная в диапазон 0..1 и переведённая в яркость.
- ControlNet Depth модель получает эту карту и направляет диффузию: близкие зоны рисуются крупнее и в фокусе, дальние — мельче и размытее.
Что хорошо считывает Depth-препроцессор:
- Размещение объектов в пространстве (передний/задний план).
- Перспективу комнат и улиц.
- Складки одежды и объём фигур.
- Лестницы, мосты, вытянутые сцены.
Что хуже:
- Отражения в зеркалах (V2 справляется лучше).
- Прозрачные стёкла.
- Сложные перекрытия с похожей текстурой.
- Сцены без явных глубинных подсказок (ровный текст, абстрактные узоры).
Пример на практике
Дизайнер работает над концептом для VR-проекта. Главное помещение — лаборатория алхимика: высокие потолки, стол посередине, шкафы по стенам, мансардное окно сверху.
Делает грубую 3D-модель в Blender за 15 минут (всё серое, без текстур). Рендерит из нужной точки. Скармливает в ComfyUI:
Load Image → Depth Anything V2 Preprocessor →
Apply ControlNet Depth (strength 0.8) → KSampler
Промпт: dark alchemist laboratory, glowing potions, crystal lamps, dust in light beams, cinematic.
Один рендер 3D + Depth → 8 разных вариантов лаборатории. Все — с одной композицией: стол в центре, шкафы на местах, лучи света через окно. Меняется только наполнение, стиль, освещение, мелочи.
В FLUX есть нативная поддержка Depth ControlNet через Union или специализированные модели. Качество высокое, особенно на сложных архитектурных сценах.
С чем часто путают
- Depth Map и Normal Map — Depth даёт расстояние до камеры. Normal — направление поверхности (куда «смотрит» каждая точка). Normal используется в 3D-движках, в SD редко.
- Depth и OpenPose — Depth держит композицию сцены, OpenPose — позу человека. Часто комбинируют: Depth для интерьера + OpenPose для фигуры внутри.
- Depth и Z-buffer (3D) — в 3D-движках Z-buffer хранит точные расстояния от камеры. Depth Map в SD — это оценка, основанная на одном изображении, не точное измерение.
- MiDaS и ZoeDepth и Depth-Anything — все три делают depth-карту, но разными моделями и с разной точностью. Depth-Anything-V2 в 2026 — лучший выбор по умолчанию.
- Relative Depth и Metric Depth — Relative показывает «А ближе, чем Б». Metric (ZoeDepth) пытается сказать абсолютное расстояние в метрах. В SD используется Relative.
Частые ошибки и заблуждения
- «Depth Map гарантирует одинаковую сцену». Не гарантирует. Управляет глубиной, но детали (текстуры, материалы, цвет) генерируются заново. Композиция стабильна, наполнение — нет.
- «Чем светлее карта, тем ближе объект». Это договорённость. В большинстве реализаций (MiDaS, Depth-Anything) — да: ближе = светлее. Но есть варианты с обратной шкалой; всегда проверять.
- «Depth работает только с реалистичными фотографиями». Работает с чем угодно: рисунки, 3D-наброски, чертежи. Главное — наличие глубинных подсказок в изображении.
- «Depth ControlNet даёт точные пропорции в метрах». Нет, это relative depth. Если нужны точные размеры — лучше брать ZoeDepth и калибровать вручную.
- «Не нужен препроцессор, можно сразу свою карту». Можно! Если у вас уже есть depth-карта (из 3D-движка, Photoshop, ручной), её можно подать напрямую в ControlNet, минуя препроцессор.
Связанные термины
- ControlNet — общий механизм, частью которого является Depth.
- OpenPose — комплементарный контроль позы.
- Canny Edge — комплементарный контроль контуров.
- Segmentation Map — другой подход к структуре сцены.
- Normal Map — родственный концепт из 3D-графики.
- MiDaS / ZoeDepth / Depth-Anything — модели препроцессоров.
- IP-Adapter — для переноса стиля, не композиции.
Частые вопросы
Какой препроцессор лучше выбрать?
В 2026-м — Depth Anything V2. Он точнее MiDaS на 30–40% и почти не уступает ZoeDepth по абсолютным расстояниям. По умолчанию хороший выбор.
Можно ли получить depth-карту из видео? Да. ComfyUI и AnimateDiff умеют обрабатывать видео покадрово. Также есть специальные модели Video Depth, дающие temporal-стабильную карту.
Depth работает с FLUX? Да. ControlNet Depth для FLUX доступен через Union ControlNet (InstantX), X-Labs или Mistoline. По качеству близко к SDXL.
Что такое «inverse depth»? Перевёрнутая шкала: ближе — темнее, дальше — светлее. Иногда используется в академических работах. Большинство SD-моделей ожидают «нормальную» шкалу (ближе = светлее).
Как комбинировать Depth с другим ControlNet?
В ComfyUI — последовательно: Apply ControlNet (Depth) → Apply ControlNet (Canny) → KSampler. В AUTOMATIC1111 — несколько вкладок ControlNet (Multi-ControlNet, по умолчанию доступно).
Можно ли нарисовать depth-карту вручную? Можно, но кропотливо. В Photoshop: чёрный фон → серым закрасить средние объекты → белым передний план. Применить Gaussian Blur 5–10 px для плавности. Подать в ControlNet.
Главное
Depth Map — это карта глубины кадра в чёрно-белом виде, где яркость = близость к камере. В Stable Diffusion через ControlNet Depth она удерживает 3D-композицию: расстановку объектов, перспективу, объём. Стандартный сценарий: один эскиз сцены → много вариантов в разных стилях с одной композицией. Препроцессоры в 2026 — Depth-Anything-V2 (лучший по качеству), MiDaS (классика), ZoeDepth (для метрических расстояний). В сочетании с Canny Edge даёт почти полный контроль архитектуры. Главное преимущество перед другими ControlNet — реальный 3D-контроль вместо плоского обводного.