Alibaba Qwen представи Qwen-Image-2.1-Turbo — 7B модел за изображения с 8 стъпки
Екипът на Qwen на Alibaba пусна Qwen-Image-2.1-Turbo – ускорена версия на модела с отворени тегла Qwen-Image-2.1. Той генерира и редактира изображения за 8 стъпки на премахване на шума вместо стандартните за базовия модел 40 стъпки. За разработчиците това означава 5 пъти по-малко стъпки на премахване на шума при същата 7B архитектура, както и опция за хостван API.
Накратко
- Размер: 7B параметъра във визуалния генератор, съчетани с текстов енкодер Qwen3-VL 8B.
- Работи на: CUDA GPU в BF16 чрез Diffusers. Qwen не посочва минимално количество VRAM за Turbo. Unsloth изчислява, че базовият модел работи с 11 GB VRAM с GGUF и 24 GB с INT8/FP8.
- Производителност: Същите 2K изход и функции за редактиране като Qwen-Image-2.1, но за 8 вместо 40 стъпки.
- Най-доброто: Базовият Qwen-Image-2.1 постига 60.28 точки в Qwen-Image-Bench – най-високият резултат при модели с отворени тегла, отчетен от Qwen.
- Извод (най-доброто): Генериране и редактиране в 2K за 8 стъпки в един модел с отворени тегла.
- Извод (най-лошото): Лицензът е само за изследователски цели, така че за самостоятелно хостване с търговска цел е необходимо отделно разрешение.
Какво представлява Qwen-Image-2.1-Turbo?
Qwen-Image-2.1-Turbo е модел за генериране и редактиране на изображения за 8 стъпки от екипа на Qwen на Alibaba. Той е изграден върху Qwen-Image-2.1. Turbo запазва същата 7B архитектура за визуално генериране. Зарежда се директно чрез QwenImage21Pipeline в Diffusers.
Моделът се доставя със запазен вътре препоръчителен график за семплиране от 8 стъпки. По подразбиране генерирането използва CFG=1. Кеширането на Prefix KV преизползва контекста на текста и референтното изображение между стъпките за премахване на шума.
Как работи Qwen-Image-2.1-Turbo?
Базовата архитектура е еднопоточен DiT с 32 слоя и 7B параметъра. Тя използва блоково-каузално внимание. Текстовите токени получават каузална маска на ниво токен, докато изображенията използват двупосочна маска на ниво блок.
- Текстов енкодер: Qwen3-VL 8B кодира както инструкциите, така и изображенията за условие.
- VAE: RGBA автоенкодер с 64 канала и 16-кратно пространствено компресиране, което позволява естествена прозрачност.
- Планировчик: Flow Matching с дискретно планиране на Euler и динамично изместване.
Именно дизайнът на механизма за внимание прави възможно кеширането на префикса. Входните изображения и текстът се изчисляват веднъж при първата стъпка. Всяка следваща стъпка използва повторно този кеш. При само 8 стъпки кешираният префикс покрива по-голямата част от разходите за условието.
Какво може да генерира и редактира?
Представянето на модела Turbo обхваща 8 категории. Сред тях са портрети, човешки пози, прозрачни изображения, типография и плакати, както и оформления на потребителски интерфейси. Примерите за редактиране включват трансформация на едно изображение, композиция с множество референции и интериорна композиция от 4 изображения. Базовият модел поддържа до 10 референтни изображения и локални редакции чрез кръгове, нарисувани анотации или маски.
Как се стартира Qwen-Image-2.1-Turbo?
Настройката изисква Diffusers от изходния код, както и transformers>=5.17.0. Моделът изисква Diffusers PR #14950, който добавя сигми за семплиране, конфигурирани в pipeline.
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1-Turbo", dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A ceramic teapot on a wooden table, soft window light",
width=2048, height=2048, use_kv_cache=True,
).images[0]За редактиране подайте image=input_image с инструкция в prompt. Поддържаните предварително зададени формати варират от квадратен 2048×2048 до 2752×1536 при съотношение 16:9.
Тук трябва да се отбележи едно нещо. Самото задаване на num_inference_steps не отменя запазения график. Това може да стане само чрез изричен аргумент sigmas, а Qwen отбелязва, че други графици не са тествани.
Колко струва API?
Alibaba Cloud Model Studio вече хоства както Turbo, така и Pro. qwen-image-2.1-turbo струва 0,1 китайски юана на изображение в повечето региони, с ограничение от 120 RPM. qwen-image-2.1-pro струва 0,25 китайски юана на изображение, с 20 RPM. Turbo е 2,5 пъти по-евтин на изображение и позволява 6 пъти по-висока честота на заявките.
Qwen-Image-2.1-Turbo срещу конкурентни бързи модели за изображения
| Функция | Qwen-Image-2.1-Turbo | Qwen-Image-2.1 | Z-Image-Turbo | FLUX.2 klein 9B |
|---|---|---|---|---|
| Организация | Alibaba Qwen | Alibaba Qwen | Alibaba Tongyi-MAI | Black Forest Labs |
| Размер на генератора | 7B | 7B | 6B | 9B |
| Текстов енкодер | Qwen3-VL 8B | Qwen3-VL 8B | Не е оповестен | Qwen3 8B |
| Стъпки по подразбиране | 8 | 40 | 8 NFE | 4 |
| Редактиране | Да, с множество референции | Да, до 10 референции | Не (отделен Edit модел) | Да, с множество референции |
| Прозрачен RGBA изход | Да | Да | Не е оповестено | Не е оповестено |
| Естествена разделителна способност | 2K (2048×2048) | 2K (2048×2048) | 1024×1024 в примерите | 1024×1024 в примерите |
| Хардуерни изисквания | Не са оповестени | 11 GB GGUF / 24 GB FP8 (Unsloth) | Работи с 16 GB VRAM | ~29 GB VRAM, RTX 4090+ |
| Лиценз | Qwen Research License | Qwen Research License | Apache 2.0 | FLUX Non-Commercial |
| Qwen-Image-Bench | Не е оповестен | 60.28 (доставчик) | Не е оповестен | Не е оповестен |
| Хостван API | 0,1 китайски юана/изображение | Pro: 0,25 китайски юана/изображение | Не е оповестен | BFL API |
Основни изводи
- Qwen-Image-2.1-Turbo намалява премахването на шума от 40 на 8 стъпки при същата 7B архитектура.
- Един модел поддържа текст-към-изображение в 2K, редактиране с множество референции и прозрачен RGBA изход.
- API струва 0,1 китайски юана на изображение – 2,5 пъти по-евтино от Pro.
- Теглата са лицензирани за изследователски цели, така че за самостоятелно хостване с търговска цел е необходимо отделно разрешение.
- Все още няма специфичен бенчмарк за Turbo; базовият Qwen-Image-2.1 постига 60.28 точки в Qwen-Image-Bench.
Разгледайте страницата в ModelScope, страницата в Hugging Face, Pro API и Turbo API. Всички заслуги са за изследователя на този проект. Също така не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.