Релизы

Qwen-Image-2.1: прозрачный фон, до 10 референсов и редактирование в одной модели

Полный перевод анонса Qwen-Image-2.1: генерация и редактирование изображений, работа с прозрачностью и объединение нескольких референсов. Сохранили все демонстрации авторов — 48 изображений и два видео.

Опубликовано

Автор оригинала — QwenTeam. Опубликовано 20 сентября 2026 года. Перевод и пояснения редакции — Neurosaver. Читать оригинал на сайте Qwen.

Ниже — полный перевод статьи «Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation» с исходными демонстрациями. Заявления о качестве и скорости переданы от лица авторов. Изображения и видео размещены на хостинге Qwen; надписи внутри оригинальных изображений оставлены без изменений. Редакционное примечание после перевода отделено от текста разработчиков.

Qwen-Image-2.1: обложка оригинального анонса QwenTeam.
Qwen-Image-2.1: обложка оригинального анонса QwenTeam. Источник: QwenTeam.

Qwen-Image-2.1: компактная и эффективная модель для создания изображений

Мы представляем Qwen-Image-2.1 — модель семейства Qwen, в которой стремились сбалансировать качество изображений, скорость работы и вычислительные затраты. Она объединяет генерацию по текстовому описанию и редактирование изображений. Генеративная визуальная часть содержит всего 7 миллиардов параметров, а создание и редактирование изображений с прозрачностью поддерживается непосредственно самой моделью.

В этом обновлении четыре основных улучшения:

  • Компактность и эффективность. Облегчённая архитектура и оптимизация инференса помогают сочетать качество изображений с умеренными вычислительными затратами.
  • Встроенная прозрачность, единая генерация и редактирование. По запросу можно создавать обычные изображения или изображения с прозрачностью, редактировать прозрачные слои и извлекать объекты из фотографий.
  • Разнообразные возможности редактирования. Модель принимает до 10 референсов, позволяет задавать локальные изменения, сохранять особенности людей и товаров и решать разные типы задач.
  • Реалистичные фактуры и более точная работа с визуальным оформлением. Улучшены типографика, свет в портретах и мелкие детали, от которых зависит убедительность изображения.

Компактность и эффективность

В основе Qwen-Image-2.1 — облегчённая архитектура. Её генеративная визуальная часть состоит из 32 слоёв Single-Stream DiT и содержит 7 миллиардов параметров. Несмотря на компактный размер, модель показывает высокое качество генерации. На графике Qwen-Image-Bench ниже её результаты сопоставлены с другими открытыми и закрытыми моделями.

Сравнение на Qwen-Image-Bench. График и оценки разработчиков, не независимый тест Neurosaver.
Сравнение на Qwen-Image-Bench. График и оценки разработчиков, не независимый тест Neurosaver. Источник: QwenTeam.

Ещё одно направление работы — эффективность инференса, особенно при редактировании с несколькими входными изображениями. Для этого используется архитектура внимания с разной гранулярностью. Текст, включая системный префикс и инструкции редактирования, обрабатывается с причинной маской на уровне токенов, а генерация изображения — с маской на уровне блоков.

Повторное использование KV-кэша позволяет рассматривать входные изображения и инструкции как неизменный контекст: он вычисляется и сохраняется в кэш на первом шаге. Это повышает эффективность инференса и уменьшает расход памяти.

Архитектура внимания: текст обрабатывается на уровне токенов, изображения — на уровне блоков. Схема QwenTeam.
Архитектура внимания: текст обрабатывается на уровне токенов, изображения — на уровне блоков. Схема QwenTeam. Источник: QwenTeam.

Встроенная прозрачность: создание и редактирование в одной модели

Поддержка прозрачности — одно из главных дополнений этого выпуска. В декабре 2025 года мы представили Qwen-Image-Layered, отдельную модель для генерации изображений с прозрачностью. Теперь Qwen-Image-2.1 включает эту возможность в общую модель: запрос определяет, будет ли результат обычным изображением или изображением с каналом прозрачности.

Вот примеры прозрачных изображений, созданных непосредственно по тексту:

Примеры генерации изображений с прозрачностью по тексту: персонаж с драконом, цветочный портрет и человек за ноутбуком. — изображение 1 из 3Примеры генерации изображений с прозрачностью по тексту: персонаж с драконом, цветочный портрет и человек за ноутбуком. — изображение 2 из 3Примеры генерации изображений с прозрачностью по тексту: персонаж с драконом, цветочный портрет и человек за ноутбуком. — изображение 3 из 3
Примеры генерации изображений с прозрачностью по тексту: персонаж с драконом, цветочный портрет и человек за ноутбуком. Источник: QwenTeam.

Модель может генерировать не только отдельные объекты, но и более сложные прозрачные композиции из нескольких элементов. Это расширяет возможности для дизайна и создания графических материалов.

Прозрачные композиции из нескольких элементов: украшения и группа рисованных собак. — изображение 1 из 2Прозрачные композиции из нескольких элементов: украшения и группа рисованных собак. — изображение 2 из 2
Прозрачные композиции из нескольких элементов: украшения и группа рисованных собак. Источник: QwenTeam.

Объединение генерации и редактирования позволяет непосредственно изменять прозрачные изображения. Например, можно поменять выражение лица персонажа, сохранив прозрачный фон. Слева показан исходник, справа — результат.

Редактирование выражения лица с сохранением прозрачности: исходник слева, результат справа. — изображение 1 из 2Редактирование выражения лица с сохранением прозрачности: исходник слева, результат справа. — изображение 2 из 2
Редактирование выражения лица с сохранением прозрачности: исходник слева, результат справа. Источник: QwenTeam.

Текст внутри прозрачного слоя тоже можно редактировать. В следующем примере надпись «BLOOM» заменена на «Qwen-Image».

Замена текста на прозрачном слое: BLOOM слева, Qwen-Image справа. — изображение 1 из 2Замена текста на прозрачном слое: BLOOM слева, Qwen-Image справа. — изображение 2 из 2
Замена текста на прозрачном слое: BLOOM слева, Qwen-Image справа. Источник: QwenTeam.

Эта возможность работает и с реальными фотографиями. Из RGB-изображения модель может извлечь нужный объект в отдельный RGBA-слой с прозрачностью. Такой элемент удобнее использовать в дальнейшей работе над дизайном и композицией.

Извлечение ветвей из фотографии в прозрачный слой: фотография слева, результат справа. — изображение 1 из 2Извлечение ветвей из фотографии в прозрачный слой: фотография слева, результат справа. — изображение 2 из 2
Извлечение ветвей из фотографии в прозрачный слой: фотография слева, результат справа. Источник: QwenTeam.

Возможности редактирования

В Qwen-Image-2.1 улучшены четыре направления: работа с несколькими референсами, локальное редактирование, сохранение исходных особенностей и разнообразие поддерживаемых задач.

Несколько референсов: до 10 входных изображений

Qwen-Image-2.1 поддерживает до 10 изображений-референсов и объединяет несколько персонажей и объектов в цельную композицию. В примере ниже шесть отдельных портретов, показанных слева, собраны в одну групповую фотографию.

Групповая фотография, сгенерированная по шести отдельным портретам.
Групповая фотография, сгенерированная по шести отдельным портретам. Источник: QwenTeam.

Для виртуальной примерки можно объединить пять исходников — фотографию модели, одежду, обувь, сумку и головной убор — в законченный образ.

Образ, собранный из пяти референсов: модель, одежда, обувь, сумка и головной убор.
Образ, собранный из пяти референсов: модель, одежда, обувь, сумка и головной убор. Источник: QwenTeam.

В дизайне интерьеров модель может использовать 10 изображений предметов обстановки, чтобы создать готовую композицию комнаты.

Интерьер, созданный по десяти изображениям предметов обстановки.
Интерьер, созданный по десяти изображениям предметов обстановки. Источник: QwenTeam.

Локальное редактирование: разные способы выделить область

Qwen-Image-2.1 позволяет указывать место изменения с помощью обводки, закрашенных областей или отдельных масок.

В первом примере обводки разных цветов обозначают сразу три области: «Убери металлические часы в синем круге, сделай волосы в красном круге чёрными и замени область в зелёном круге на серую льняную пижаму с короткими рукавами». Слева — исходник с разметкой, справа — результат.

Локальные изменения по цветной обводке: исходник с разметкой слева, результат справа. — изображение 1 из 2Локальные изменения по цветной обводке: исходник с разметкой слева, результат справа. — изображение 2 из 2
Локальные изменения по цветной обводке: исходник с разметкой слева, результат справа. Источник: QwenTeam.

Другой способ указать область — закрасить её. В этом примере модель добавляет дайвера в место, отмеченное белым справа на исходном изображении.

Добавление дайвера в закрашенную область: разметка слева, изменённая сцена справа. — изображение 1 из 2Добавление дайвера в закрашенную область: разметка слева, изменённая сцена справа. — изображение 2 из 2
Добавление дайвера в закрашенную область: разметка слева, изменённая сцена справа. Источник: QwenTeam.

Обводка и закрашивание закрывают часть исходного изображения. Чтобы сохранить его целиком, Qwen-Image-2.1 также принимает оригинал и отдельную маску как два входных изображения. В следующем примере модель просят создать ковбоя верхом на лошади, используя эти два исходника:

Два отдельных входных изображения: исходная фотография лошади и маска области редактирования. — изображение 1 из 2Два отдельных входных изображения: исходная фотография лошади и маска области редактирования. — изображение 2 из 2
Два отдельных входных изображения: исходная фотография лошади и маска области редактирования. Источник: QwenTeam.

Модель изменяет область, заданную маской, и получает такой результат:

Результат редактирования по маске: ковбой верхом на лошади.
Результат редактирования по маске: ковбой верхом на лошади. Источник: QwenTeam.

Локальное редактирование подходит и для последовательного создания сцены. Если вносить изменения одно за другим, сохраняя остальные части изображения, полученные кадры можно собрать в простую анимацию. Ниже — пример с капибарами в образах героев «Братьев-тыкв» (Calabash Brothers).

Анимация с капибарами, собранная из последовательных правок изображений. Видео QwenTeam. Источник: QwenTeam.

Сохранение исходных особенностей: люди и товары

Улучшения в этой области касаются узнаваемости людей на портретах и постоянства внешнего вида товаров. При работе с портретами модель лучше сохраняет черты лица, чтобы человек оставался узнаваемым после редактирования. В каждой паре ниже слева находится исходник, справа — изменённое изображение.

Сохранение узнаваемости при смене сцены: исходный портрет слева, результат справа. — изображение 1 из 2Сохранение узнаваемости при смене сцены: исходный портрет слева, результат справа. — изображение 2 из 2
Сохранение узнаваемости при смене сцены: исходный портрет слева, результат справа. Источник: QwenTeam.
Изменение причёски: исходник слева, результат справа. — изображение 1 из 2Изменение причёски: исходник слева, результат справа. — изображение 2 из 2
Изменение причёски: исходник слева, результат справа. Источник: QwenTeam.
Перенос героини в другую обстановку: исходник слева, результат справа. — изображение 1 из 2Перенос героини в другую обстановку: исходник слева, результат справа. — изображение 2 из 2
Перенос героини в другую обстановку: исходник слева, результат справа. Источник: QwenTeam.

При редактировании изображений товаров модель стремится сохранять надписи, фактуры и форму, чтобы характерные особенности предмета оставались такими же и в новой сцене.

Флакон в новой сцене: исходник слева, результат справа. Пример сохранения формы и надписей. — изображение 1 из 2Флакон в новой сцене: исходник слева, результат справа. Пример сохранения формы и надписей. — изображение 2 из 2
Флакон в новой сцене: исходник слева, результат справа. Пример сохранения формы и надписей. Источник: QwenTeam.
Платье с манекена на модели: исходник слева, результат справа. — изображение 1 из 2Платье с манекена на модели: исходник слева, результат справа. — изображение 2 из 2
Платье с манекена на модели: исходник слева, результат справа. Источник: QwenTeam.
Браслет на руке: отдельный предмет слева, результат справа. — изображение 1 из 2Браслет на руке: отдельный предмет слева, результат справа. — изображение 2 из 2
Браслет на руке: отдельный предмет слева, результат справа. Источник: QwenTeam.

Разные задачи: панорамы, инфографика и раскадровки

Qwen-Image-2.1 поддерживает широкий набор задач редактирования, включая создание панорам, инфографики и раскадровок. Мы стремились сбалансировать возможности модели для разных сценариев применения.

Например, на вход можно подать такое селфи:

Исходное селфи для создания панорамы.
Исходное селфи для создания панорамы. Источник: QwenTeam.

И получить следующую панораму:

Панорама, сгенерированная по селфи.
Панорама, сгенерированная по селфи. Источник: QwenTeam.

Затем панораму можно рассматривать с разных направлений в инструменте визуализации.

Просмотр сгенерированной панорамы с разных направлений. Видео QwenTeam. Источник: QwenTeam.

При создании инфографики фотографию модели можно превратить в подробную композицию с большим количеством информации.

Исходная фотография модели для создания инфографики.
Исходная фотография модели для создания инфографики. Источник: QwenTeam.
Подробная инфографика, созданная по фотографии модели. Надписи сохранены как в оригинале.
Подробная инфографика, созданная по фотографии модели. Надписи сохранены как в оригинале. Источник: QwenTeam.

Модель также может превратить референс персонажа в трёх ракурсах в полноценную раскадровку — материал для истории и визуального повествования.

Референс персонажа в трёх ракурсах и крупный портрет.
Референс персонажа в трёх ракурсах и крупный портрет. Источник: QwenTeam.
Раскадровка, созданная по референсу персонажа.
Раскадровка, созданная по референсу персонажа. Источник: QwenTeam.

Реалистичные фактуры и более точное визуальное оформление

В Qwen-Image-2.1 дополнительно улучшено качество изображений, особенно типографика и портреты. При отрисовке текста учитывается не только само содержание, но и начертание, расположение надписей и их связь с общей композицией. Следующие примеры показывают работу с текстом в разных условиях.

Пример отрисовки текста: макет научной страницы с графиками и таблицами. Это демонстрация генерации, не научный источник.
Пример отрисовки текста: макет научной страницы с графиками и таблицами. Это демонстрация генерации, не научный источник. Источник: QwenTeam.
Пример отрисовки текста и компоновки: иллюстрированный лист о замке.
Пример отрисовки текста и компоновки: иллюстрированный лист о замке. Источник: QwenTeam.
Пример генерации текста в макете туристического приложения.
Пример генерации текста в макете туристического приложения. Источник: QwenTeam.
Пример генерации страницы с математическими заданиями. Содержание демонстрации не проверялось как учебный материал.
Пример генерации страницы с математическими заданиями. Содержание демонстрации не проверялось как учебный материал. Источник: QwenTeam.

В портретах более точная работа со светом и мелкими деталями делает сгенерированные изображения реалистичнее.

Свет и детали в сгенерированном портрете женщины в соломенной шляпе.
Свет и детали в сгенерированном портрете женщины в соломенной шляпе. Источник: QwenTeam.
Свет и детали в сгенерированном портрете мужчины у причала.
Свет и детали в сгенерированном портрете мужчины у причала. Источник: QwenTeam.

Заключение

Qwen-Image-2.1 с компактной генеративной визуальной частью на 7 миллиардов параметров объединяет создание изображений, поддержку прозрачности и разнообразные возможности редактирования. Более быстрый инференс, до 10 референсов, гибкое локальное редактирование и лучшее сохранение особенностей людей и товаров делают её практичным инструментом для дизайна, создания контента, электронной торговли и визуального повествования.

Надеемся, вам понравится создавать изображения с Qwen-Image-2.1!


Примечание редакции Neurosaver

Выше закончился перевод статьи QwenTeam. График, примеры и выводы о качестве принадлежат разработчикам. Они не означают, что модель безошибочно сохраняет лицо, надписи или детали товара в любой задаче. Видео с капибарами показывает анимацию, собранную из результатов последовательного редактирования, а не доказательство наличия у модели отдельного режима генерации видео.

Есть и существенная оговорка о лицензии: веса опубликованы под Qwen Research License, а не Apache 2.0. В тексте лицензии использование материалов ограничено исследованием и оценкой; для коммерческого применения предусмотрена отдельная лицензия. Условия в официальном репозитории.

Если вы разбираетесь в обработке изображений, материалы Timesaver помогут связать эти примеры с практикой. Базовые приёмы работы с масками и последовательностями обработки можно изучать в разделе ComfyUI. Сам этот перевод не является инструкцией по установке Qwen-Image-2.1 и не подтверждает совместимость с конкретным набором узлов.

Оригинал: Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation — QwenTeam, 20 сентября 2026. Изображения и видео показаны без перерисовки и размещаются на исходном хостинге. Переведены текст, подписи и описания изображений; если оригинальные файлы будут удалены, эти встроенные материалы станут недоступны.

Источник: QwenTeam — оригинальная статья от 20 сентября 2026 ↗