FLUX

flux.1 — диффузионная модель нового поколения от Black Forest Labs

Раздел
Генеративные модели
Обновлено
19.06.26

FLUX (FLUX.1) — семейство диффузионных моделей для генерации изображений, выпущенное Black Forest Labs в августе 2024 года. Команда — те же исследователи, что начинали Stable Diffusion. По размеру модель в пять раз больше SDXL: 12 миллиардов параметров. Главное преимущество над SD — точное следование длинным промптам, естественные руки и читаемый текст на картинке. Три варианта: Schnell (открытый, быстрый), Dev (открытый, качественный), Pro (закрытый, эталонный).

Коротко

Коротко. FLUX — open-source диффузионная модель от Black Forest Labs (август 2024), которая впервые догнала Midjourney и DALL-E 3 по качеству и обогнала их по следованию длинному промпту. 12 миллиардов параметров, новая гибридная архитектура MMDiT + DiT, читаемый текст на картинке и почти решённые «AI-руки». В 2026 году — главный open-source конкурент закрытых моделей.

Что это такое

Лето 2024-го. Stability AI после серии скандалов и финансовых проблем теряет ключевых исследователей. Робин Ромбах и команда, придумавшие диффузию для Stable Diffusion, уходят и основывают Black Forest Labs.

В августе они публикуют FLUX.1 — и сообщество ахает. Картинки выглядят как Midjourney v6, но веса можно скачать. Текст на вывеске пишется без артефактов. Руки — с правильным числом пальцев. Промпты на 200 слов модель понимает целиком, без потери начала.

К концу 2024-го FLUX становится новым стандартом open-source качества. К 2026-му — основой профессиональных пайплайнов в рекламе, кино и продакт-дизайне.

Три открытые версии:

  • FLUX.1 [pro] — закрытая, только через API Black Forest Labs. Эталонное качество. Цена — порядка 5 центов за изображение.
  • FLUX.1 [dev] — open weights, 12 миллиардов параметров, 23 ГБ. Бесплатно для исследований и личного использования, для коммерции нужна лицензия Black Forest Labs.
  • FLUX.1 [schnell] — Apache 2.0, полностью свободна, 4-шаговая дистилляция. Качество чуть ниже Dev, скорость в 7 раз выше.

Как это работает

Архитектура FLUX — гибрид двух подходов. Первая часть модели — двухпоточный MMDiT (Multi-Modal Diffusion Transformer), где текст и картинка обрабатываются параллельно и обмениваются вниманием. Вторая часть — однопоточный DiT, дополняющий обработку. Это объединение и даёт FLUX его сильное следование промпту.

Главные технические отличия от SDXL:

  1. Transformer вместо U-Net. Старая Stable Diffusion работала на свёрточной U-Net. FLUX использует transformer-блоки — те же, что в LLM. Это даёт лучшее «семантическое» понимание промпта.
  2. Один T5-XXL вместо двух CLIP. Текстовый энкодер — мощный языковой T5-XXL (5 миллиардов параметров), который читает длинные предложения как обычная LLM.
  3. Rectified Flow вместо классической диффузии. Математически другой способ переходить от шума к картинке, требующий меньше шагов.

При запуске FLUX Dev в FP16 нужно около 24 ГБ VRAM. В FP8 (с потерей качества в районе 2–5%) — 12 ГБ. В квантизованном GGUF Q4 — 8–10 ГБ. ComfyUI поддерживает все три формата из коробки.

Пример на практике

Команда из трёх дизайнеров делает каталог для бренда мебели. 200 фото-карточек, каждая — диван или кресло в интерьере, нужен читаемый ценник на стене с конкретной ценой.

В SDXL такая задача почти невыполнима: ценник либо превращается в кашу, либо ставит случайные цифры. В FLUX Dev — работает с первой попытки. Промпт «modern living room, beige sofa, framed price tag on the wall reading $1,290» — модель пишет именно «$1,290» в большинстве кадров.

На RTX 4090 24 ГБ один кадр FLUX Dev (1024×1024, 28 шагов) занимает 25 секунд. 200 кадров — 90 минут. На RTX 4070 в FP8 — 45 секунд на кадр, 200 кадров за три часа.

Для черновиков команда переключается на FLUX Schnell: 4 шага, 4 секунды на кадр, качество примерно как у SDXL — но картинка собирается мгновенно.

С чем часто путают

  • FLUX и Stable Diffusion — разные семейства от разных компаний. FLUX от Black Forest Labs, SD от Stability AI. Веса несовместимы, LoRA несовместимы, ControlNet — свои. Общее только происхождение команды.
  • FLUX Schnell и FLUX Dev — Schnell обучен на 4 шага через distillation, Dev — на 20–28 шагов обычным способом. Schnell быстрее, но менее гибкий: с CFG > 1 или ControlNet работает хуже.
  • FLUX [pro] и FLUX [dev] — pro закрытая, только через API. Dev — те же ~12B параметров, но веса открыты. По качеству Pro чуть выше, разница заметна только на сложных композициях.
  • FLUX и SD 3.5 — оба используют MMDiT, но FLUX крупнее (12B vs 8.1B) и обучен на других данных. На большинстве задач FLUX даёт более чистый результат.

Частые ошибки и заблуждения

  • «FLUX можно использовать в коммерческих проектах бесплатно». Только Schnell (Apache 2.0). У Dev нужна коммерческая лицензия Black Forest Labs; у Pro — оплата через API. Это самая частая юридическая ошибка.
  • «FLUX заменяет ControlNet и LoRA». Не заменяет. FLUX лучше базово, но для жёсткого контроля композиции, лица или фирменного стиля те же инструменты нужны. FLUX-версии LoRA и ControlNet существуют и развиваются.
  • «FLUX Schnell — это просто ускоренная Dev». Нет. Schnell прошла отдельную distillation-тренировку. С CFG больше 1 и с большинством LoRA она работает хуже Dev. Это разные модели для разных задач.
  • «FLUX выдаёт результат с первого раза». Чаще, чем SDXL, — да. Но всё ещё нужны итерации: подбор seed, корректировка промпта, иногда inpainting.
  • «FLUX медленный, проще остаться на SDXL». Зависит от задачи. Если важен текст на картинке, точная композиция или сложный промпт — FLUX окупает время. Если нужна массовая генерация черновиков — Schnell иногда быстрее SDXL Base.

Связанные термины

  • Black Forest Labs — компания, создавшая FLUX. Часть основателей раньше работала в Stability AI.
  • Stable Diffusion / SDXL — предыдущее поколение open-source моделей.
  • MMDiT — архитектура transformer-диффузии, на которой построен FLUX и SD 3.
  • T5-XXL — текстовый энкодер внутри FLUX, мощнее CLIP.
  • Rectified Flow — математическая основа FLUX, альтернатива классической диффузии.
  • ComfyUI — основной интерфейс для запуска FLUX и работы с его пайплайном.
  • GGUF-квантизация — формат сжатия весов, позволяющий запускать FLUX на 8 ГБ VRAM.

Частые вопросы

Какой вариант FLUX выбрать? Для коммерческой работы без подписок — Schnell (Apache 2.0). Для максимума качества и тренировки своих LoRA — Dev. Для эталонного качества без локального запуска — Pro через API. Большинство студий держат Dev для финальных рендеров, Schnell для черновиков.

Сколько VRAM нужно для FLUX? Dev в FP16 — 24 ГБ. Dev в FP8 — 12 ГБ (NF4 — 8–10 ГБ). Schnell в FP8 — 8 ГБ. Через ComfyUI с GGUF Q4 запустится даже на 6 ГБ, но придётся ждать 90+ секунд на кадр.

Можно ли тренировать LoRA для FLUX? Да, через AI-Toolkit или Kohya_ss с FLUX-конфигом. Минимум — 24 ГБ VRAM, лучше 48 ГБ. Облачные сервисы (Replicate, RunPod) предлагают тренировку FLUX-LoRA за 5–15 долларов.

FLUX совместим с LoRA от SDXL? Нет. Архитектуры разные. Сообщество тренирует FLUX-LoRA с нуля. К 2026-му на CivitAI уже тысячи FLUX-LoRA: стили, персонажи, объекты.

FLUX рисует текст лучше Midjourney? В большинстве случаев — да. На английском короткие фразы и числа FLUX пишет почти безошибочно, Midjourney до v6.1 часто промахивается. На длинных текстах и других языках обе модели всё ещё неточны.

Главное

FLUX — главный open-source конкурент закрытых моделей в 2026 году. Если задача требует точного следования промпту, читаемого текста или естественных рук — FLUX обычно выигрывает у SDXL. Платите вычислениями: FLUX в 3–5 раз тяжелее SDXL по памяти и времени. Лицензия трёхуровневая: Schnell свободен, Dev платный для коммерции, Pro — только API. Стандарт через ComfyUI с GGUF-квантизацией для экономии VRAM.