img2img
img2img — режим переписывания входной картинки по промпту
img2img (image-to-image) — режим генерации, в котором на вход модели подаётся картинка, а не случайный шум. Модель частично её «стирает» (через параметр denoise) и дорисовывает обратно, ведомая промптом. Результат — что-то между исходной картинкой и тем, что просил промпт. Главный параметр — denoising strength: от 0.1 (микро-коррекция) до 1.0 (полная перерисовка). Базовый режим в Stable Diffusion, SDXL, FLUX и Midjourney.
Коротко
Коротко. img2img — генерация на основе существующей картинки. На вход подаётся не шум, а ваш файл; модель частично его стирает и дорисовывает по промпту. От denoise зависит, насколько результат будет похож на оригинал. Главные применения: переинтерпретация стиля, ретушь, расширение скетча в финал, hi-res fix, выравнивание серии под один look.
Что это такое
Иллюстратор делает черновой набросок карандашом. Открывает Automatic1111, переключает с txt2img на img2img, загружает свой скан. Пишет промпт: «detailed oil painting, vibrant colors». Ставит denoise=0.6. Через 10 секунд получает картинку: композиция и линии наброска сохранены, но появилась объёмная живопись.
Это и есть img2img. В отличие от txt2img, где модель начинает с шума, в img2img она стартует с вашего изображения, частично зашумлённого. Сколько именно шума добавить — определяет denoise. Чем выше, тем сильнее модель переписывает; чем ниже, тем ближе к исходнику.
Главные применения:
- Style transfer — взять фотографию и переписать в стиле живописи (или наоборот).
- Ретушь — убрать дефекты, добавить освещение (denoise 0.2–0.4).
- Скетч → финал — превратить набросок в детализированную картинку (denoise 0.5–0.7).
- Hi-Res Fix — увеличить картинку через двухступенчатую генерацию.
- Видео-эффекты — обработка кадров «один к одному» в SD-стиле.
В 2026 году img2img поддерживается во всех основных инструментах: Stable Diffusion, SDXL, FLUX, ComfyUI, Automatic1111, Forge, Midjourney (через blend command), DALL-E (через edit).
Как это работает
Цикл img2img отличается от txt2img на одном шаге:
txt2img:
- Создать случайный шум 64×64×4 (или 128×128×4 для SDXL).
- KSampler делает N шагов от шума к картинке, ведомый промптом.
img2img:
- Прогнать входную картинку через VAE Encode → латент.
- Добавить шум к латенту в количестве
denoise × σ_max. - KSampler делает
denoise × Nшагов от частично-шумного латента к чистому. - VAE Decode → финальная картинка.
В Automatic1111 это вкладка «img2img». В ComfyUI — два узла: VAE Encode (превращает картинку в латент) и KSampler с denoise<1. В Midjourney — команда /imagine с image prompt (картинка в начале + текст).
Размер выхода img2img определяется размером входной картинки (плюс scale-параметр в некоторых интерфейсах). Это и удобно, и ограничивает: если вход 800×800, выход тоже 800×800.
Пример на практике
Видеомонтажёру нужно сделать AI-эффект для ролика: пять кадров реального актёра «превратить» в анимационный персонаж. Style transfer.
В ComfyUI:
- VAE Encode для каждого кадра.
- SDXL Juggernaut + LoRA «anime style» через узел Load LoRA.
- KSampler с denoise=0.55, промпт:
anime style portrait, vibrant colors, clean line art. - VAE Decode → стилизованный кадр.
За denoise=0.55 модель сохраняет лицо, позу и одежду актёра, но рисует их в анимационном стиле. 5 кадров готовы за 1 минуту. С seed-консистентностью можно идти дальше — серия 100 кадров за 20 минут.
Альтернатива — IP-Adapter с референс-картинкой стиля: дополнительный контроль, но и больше нюансов.
С чем часто путают
- img2img и inpainting — img2img переписывает картинку целиком; inpainting — только выделенную маской область, остальное сохраняется пиксель в пиксель. Разные режимы.
- img2img и txt2img — txt2img стартует с шума, img2img со зашумлённой картинки. Главное различие — стартовый латент.
- img2img и IP-Adapter — img2img использует картинку как стартовый латент. IP-Adapter использует её как «промпт через картинку». Можно сочетать.
- img2img и Hi-Res Fix — Hi-Res Fix это двухступенчатая техника: сначала txt2img на низком разрешении, потом img2img на высоком. То есть Hi-Res Fix внутри использует img2img.
Частые ошибки и заблуждения
- «img2img изменяет размер картинки». Может — если вы вручную поставите другой Width/Height. Без этого размер сохраняется.
- «img2img всегда быстрее txt2img». Чаще — да, потому что выполняется
denoise × Nшагов вместо N. Но добавляется VAE Encode (~0.1–0.3 сек). На denoise=0.9 итог почти как txt2img. - «img2img — единственный способ редактировать картинку». Не единственный. Inpainting лучше для точечной правки. ControlNet с reference — для сохранения композиции.
- «img2img работает только с SD». Работает со всеми диффузионными моделями: SD, SDXL, FLUX, SD3, видео-моделями.
- «Чтобы избежать "AI-look", достаточно низкого denoise». Не всегда. Иногда промпт сам диктует «AI-style». Лучше комбинировать низкий denoise + точный промпт.
Связанные термины
- Denoising Strength — главный параметр img2img.
- Inpainting — img2img только в выделенной области.
- Outpainting — img2img для расширения за границы картинки.
- Hi-Res Fix — двухступенчатый upscale через img2img.
- VAE Encode — узел, который превращает входную картинку в латент.
- IP-Adapter — альтернативный способ использовать картинку как «промпт».
Частые вопросы
Какой denoise выбрать? Тонкая ретушь: 0.2–0.35. Сохранение композиции, смена стиля: 0.5–0.7. Радикальная переинтерпретация: 0.8–0.9.
Можно ли использовать img2img с FLUX? Да. В ComfyUI это VAE Encode + KSampler с denoise. Из коробки. В Forge и Automatic1111 — вкладка img2img работает с FLUX, если модель загружена.
img2img меняет размер картинки? Нет, если оставить Width/Height равными размеру входа. Если поменять — изменит. Для апскейла обычно используют отдельный Hi-Res Fix.
Можно ли запустить img2img без промпта? Можно, но результат непредсказуем. Модель попытается «привести латент к чему-то», основываясь только на статистике своего тренировочного датасета. Иногда даёт смешные результаты.
В чём разница между img2img и редактированием в Photoshop? Photoshop работает с пикселями напрямую (вы видите и правите). img2img рисует через диффузию — менее точно, более стохастично, но создаёт совершенно новые элементы.
Сохраняется ли seed между img2img и txt2img? Тот же seed на той же модели даст разные картинки, потому что стартовые латенты разные. seed — это «случайность», а не «определитель картинки».
Главное
img2img — базовый режим для работы с существующими картинками. Главный параметр — denoise: от 0.2 (тонкая правка) до 0.9 (почти переписать). Применения от ретуши и стилизации до hi-res fix и видео-эффектов. В ComfyUI это VAE Encode + KSampler с denoise<1, в Automatic1111 — отдельная вкладка. Знание img2img — половина рабочего арсенала по любой генерации.