Alibaba Qwen выпустила Qwen-Image-2.1-Turbo — 7B-модель изображений с 8 шагами
Команда Qwen компании Alibaba выпустила Qwen-Image-2.1-Turbo — ускоренный чекпойнт её модели с открытыми весами Qwen-Image-2.1. Он генерирует и редактирует изображения за 8 шагов устранения шума вместо 40 шагов по умолчанию базовой модели. Для разработчиков это означает в 5 раз меньше шагов устранения шума на той же 7B-архитектуре, а также возможность использования размещённого API.
Кратко
- Размер: 7B параметров в визуальном генераторе в сочетании с текстовым энкодером Qwen3-VL 8B.
- Запускается на: графических процессорах CUDA в BF16 через Diffusers. Qwen не публикует минимальный объём VRAM для Turbo. По оценке Unsloth, базовая модель работает с 11 ГБ VRAM с GGUF и 24 ГБ с INT8/FP8.
- Производительность: те же возможности генерации и редактирования изображений в разрешении 2K, что и у Qwen-Image-2.1, но за 8 шагов вместо 40.
- Лучшее: базовая Qwen-Image-2.1 набирает 60,28 балла в Qwen-Image-Bench — это лучший результат модели с открытыми весами по данным Qwen.
- Итог (лучшее): генерация и редактирование изображений в разрешении 2K за 8 шагов в одном открытом чекпойнте.
- Итог (худшее): только исследовательская лицензия, поэтому для коммерческого самостоятельного размещения требуется отдельное разрешение.
Что такое Qwen-Image-2.1-Turbo?
Qwen-Image-2.1-Turbo — это чекпойнт для генерации и редактирования изображений за 8 шагов от команды Qwen компании Alibaba. Он создан на основе Qwen-Image-2.1. Turbo сохраняет ту же архитектуру визуального генератора с 7B параметров. Он напрямую загружается с помощью QwenImage21Pipeline в Diffusers.
Чекпойнт поставляется с рекомендованным расписанием выборки на 8 шагов, сохранённым внутри него. По умолчанию генерация использует CFG=1. Кэширование KV-префикса повторно использует контекст текста и эталонного изображения на всех шагах устранения шума.
Как работает Qwen-Image-2.1-Turbo?
Лежащая в основе архитектура представляет собой одноотоковый DiT с 32 слоями и 7B параметров. Она использует блочно-каузальное внимание. Токены текста получают каузальную маску на уровне токенов, а изображения — двунаправленную маску на уровне блоков.
- Текстовый энкодер: Qwen3-VL 8B кодирует инструкции и изображения-условия.
- VAE: RGBA-автоэнкодер с 64 каналами и пространственным сжатием 16x, обеспечивающий встроенную поддержку прозрачности.
- Планировщик: Flow Matching с дискретным планированием Euler и динамическим сдвигом.
Именно конструкция механизма внимания делает возможным кэширование префикса. Входные изображения и текст вычисляются на первом шаге. На каждом последующем шаге этот кэш используется повторно. При всего 8 шагах кэшированный префикс покрывает большую часть затрат на обработку условий.
Что она может генерировать и редактировать?
Демонстрация возможностей модели Turbo охватывает 8 категорий. Среди них — портреты, позы человека, изображения с прозрачностью, типографика и постеры, а также макеты интерфейсов. Примеры редактирования включают преобразование одного изображения, композицию с несколькими эталонами и композицию интерьера из 4 изображений. Базовая модель поддерживает до 10 эталонных изображений и локальное редактирование с помощью кругов, нарисованных аннотаций или масок.
Как запустить Qwen-Image-2.1-Turbo?
Для установки требуется Diffusers из исходного кода, а также transformers>=5.17.0. Для чекпойнта необходим PR #14950 для Diffusers, добавляющий сигмы выборки, настроенные через конфигурацию пайплайна.
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1-Turbo", dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A ceramic teapot on a wooden table, soft window light",
width=2048, height=2048, use_kv_cache=True,
).images[0]Для редактирования передайте image=input_image вместе с инструкцией в промпте. Поддерживаемые пресеты варьируются от квадратного формата 2048×2048 до 2752×1536 при соотношении сторон 16:9.
Здесь важно отметить одну вещь. Одна лишь установка num_inference_steps не переопределяет сохранённое расписание. Это делает только явный аргумент sigmas, причём Qwen отмечает, что другие расписания не тестировались.
Сколько стоит API?
Alibaba Cloud Model Studio теперь размещает и Turbo, и Pro. qwen-image-2.1-turbo стоит 0,1 юаня КНР за изображение в большинстве регионов, лимит составляет 120 RPM. qwen-image-2.1-pro стоит 0,25 юаня КНР за изображение, лимит — 20 RPM. Turbo в 2,5 раза дешевле за изображение и допускает в 6 раз больше запросов.
Qwen-Image-2.1-Turbo в сравнении с конкурирующими быстрыми моделями изображений
| Характеристика | Qwen-Image-2.1-Turbo | Qwen-Image-2.1 | Z-Image-Turbo | FLUX.2 klein 9B |
|---|---|---|---|---|
| Организация | Alibaba Qwen | Alibaba Qwen | Alibaba Tongyi-MAI | Black Forest Labs |
| Размер генератора | 7B | 7B | 6B | 9B |
| Текстовый энкодер | Qwen3-VL 8B | Qwen3-VL 8B | Не раскрыт | Qwen3 8B |
| Шаги по умолчанию | 8 | 40 | 8 NFE | 4 |
| Редактирование | Да, несколько эталонов | Да, до 10 эталонов | Нет (отдельная модель Edit) | Да, несколько эталонов |
| Прозрачный вывод RGBA | Да | Да | Не раскрыт | Не раскрыт |
| Нативное разрешение | 2K (2048×2048) | 2K (2048×2048) | 1024×1024 в примерах | 1024×1024 в примерах |
| Рекомендации по оборудованию | Не раскрыты | 11 ГБ GGUF / 24 ГБ FP8 (Unsloth) | Работает на 16 ГБ VRAM | ~29 ГБ VRAM, RTX 4090+ |
| Лицензия | Qwen Research License | Qwen Research License | Apache 2.0 | FLUX Non-Commercial |
| Qwen-Image-Bench | Не раскрыт | 60,28 (по данным разработчика) | Не раскрыт | Не раскрыт |
| Размещённый API | 0,1 юаня КНР/изображение | Pro: 0,25 юаня КНР/изображение | Не раскрыт | API BFL |
Ключевые выводы
- Qwen-Image-2.1-Turbo сокращает число шагов устранения шума с 40 до 8 на той же архитектуре с 7B параметрами.
- Один чекпойнт поддерживает генерацию изображений из текста в разрешении 2K, редактирование с несколькими эталонами и прозрачный вывод RGBA.
- API стоит 0,1 юаня КНР за изображение — в 2,5 раза дешевле Pro.
- На веса распространяется исследовательская лицензия, поэтому для коммерческого самостоятельного размещения требуется отдельное разрешение.
- Специального бенчмарка для Turbo пока нет; базовая Qwen-Image-2.1 набирает 60,28 балла в Qwen-Image-Bench.
Посетите страницу ModelScope, страницу Hugging Face, API Pro и API Turbo. Вся заслуга принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Стоп! Вы пользуетесь Telegram? теперь вы также можете присоединиться к нам в Telegram.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.