Sakhanda Wire
NVDA — MSFT — GOOGL — META — AMZN —
← К новостям

Alibaba Qwen выпустила Qwen-Image-2.1-Turbo — 7B-модель изображений с 8 шагами

Команда Qwen компании Alibaba выпустила Qwen-Image-2.1-Turbo — ускоренный чекпойнт её модели с открытыми весами Qwen-Image-2.1. Он генерирует и редактирует изображения за 8 шагов устранения шума вместо 40 шагов по умолчанию базовой модели. Для разработчиков это означает в 5 раз меньше шагов устранения шума на той же 7B-архитектуре, а также возможность использования размещённого API.

Кратко

  • Размер: 7B параметров в визуальном генераторе в сочетании с текстовым энкодером Qwen3-VL 8B.
  • Запускается на: графических процессорах CUDA в BF16 через Diffusers. Qwen не публикует минимальный объём VRAM для Turbo. По оценке Unsloth, базовая модель работает с 11 ГБ VRAM с GGUF и 24 ГБ с INT8/FP8.
  • Производительность: те же возможности генерации и редактирования изображений в разрешении 2K, что и у Qwen-Image-2.1, но за 8 шагов вместо 40.
  • Лучшее: базовая Qwen-Image-2.1 набирает 60,28 балла в Qwen-Image-Bench — это лучший результат модели с открытыми весами по данным Qwen.
  • Итог (лучшее): генерация и редактирование изображений в разрешении 2K за 8 шагов в одном открытом чекпойнте.
  • Итог (худшее): только исследовательская лицензия, поэтому для коммерческого самостоятельного размещения требуется отдельное разрешение.

Что такое Qwen-Image-2.1-Turbo?

Qwen-Image-2.1-Turbo — это чекпойнт для генерации и редактирования изображений за 8 шагов от команды Qwen компании Alibaba. Он создан на основе Qwen-Image-2.1. Turbo сохраняет ту же архитектуру визуального генератора с 7B параметров. Он напрямую загружается с помощью QwenImage21Pipeline в Diffusers.

Чекпойнт поставляется с рекомендованным расписанием выборки на 8 шагов, сохранённым внутри него. По умолчанию генерация использует CFG=1. Кэширование KV-префикса повторно использует контекст текста и эталонного изображения на всех шагах устранения шума.

Как работает Qwen-Image-2.1-Turbo?

Лежащая в основе архитектура представляет собой одноотоковый DiT с 32 слоями и 7B параметров. Она использует блочно-каузальное внимание. Токены текста получают каузальную маску на уровне токенов, а изображения — двунаправленную маску на уровне блоков.

  • Текстовый энкодер: Qwen3-VL 8B кодирует инструкции и изображения-условия.
  • VAE: RGBA-автоэнкодер с 64 каналами и пространственным сжатием 16x, обеспечивающий встроенную поддержку прозрачности.
  • Планировщик: Flow Matching с дискретным планированием Euler и динамическим сдвигом.

Именно конструкция механизма внимания делает возможным кэширование префикса. Входные изображения и текст вычисляются на первом шаге. На каждом последующем шаге этот кэш используется повторно. При всего 8 шагах кэшированный префикс покрывает большую часть затрат на обработку условий.

Что она может генерировать и редактировать?

Демонстрация возможностей модели Turbo охватывает 8 категорий. Среди них — портреты, позы человека, изображения с прозрачностью, типографика и постеры, а также макеты интерфейсов. Примеры редактирования включают преобразование одного изображения, композицию с несколькими эталонами и композицию интерьера из 4 изображений. Базовая модель поддерживает до 10 эталонных изображений и локальное редактирование с помощью кругов, нарисованных аннотаций или масок.

Как запустить Qwen-Image-2.1-Turbo?

Для установки требуется Diffusers из исходного кода, а также transformers>=5.17.0. Для чекпойнта необходим PR #14950 для Diffusers, добавляющий сигмы выборки, настроенные через конфигурацию пайплайна.

Копировать кодСкопированоИспользовать другой браузер
import torch
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1-Turbo", dtype=torch.bfloat16
).to("cuda")

image = pipe(
    prompt="A ceramic teapot on a wooden table, soft window light",
    width=2048, height=2048, use_kv_cache=True,
).images[0]

Для редактирования передайте image=input_image вместе с инструкцией в промпте. Поддерживаемые пресеты варьируются от квадратного формата 2048×2048 до 2752×1536 при соотношении сторон 16:9.

Здесь важно отметить одну вещь. Одна лишь установка num_inference_steps не переопределяет сохранённое расписание. Это делает только явный аргумент sigmas, причём Qwen отмечает, что другие расписания не тестировались.

Сколько стоит API?

Alibaba Cloud Model Studio теперь размещает и Turbo, и Pro. qwen-image-2.1-turbo стоит 0,1 юаня КНР за изображение в большинстве регионов, лимит составляет 120 RPM. qwen-image-2.1-pro стоит 0,25 юаня КНР за изображение, лимит — 20 RPM. Turbo в 2,5 раза дешевле за изображение и допускает в 6 раз больше запросов.

Qwen-Image-2.1-Turbo в сравнении с конкурирующими быстрыми моделями изображений

ХарактеристикаQwen-Image-2.1-TurboQwen-Image-2.1Z-Image-TurboFLUX.2 klein 9B
ОрганизацияAlibaba QwenAlibaba QwenAlibaba Tongyi-MAIBlack Forest Labs
Размер генератора7B7B6B9B
Текстовый энкодерQwen3-VL 8BQwen3-VL 8BНе раскрытQwen3 8B
Шаги по умолчанию8408 NFE4
РедактированиеДа, несколько эталоновДа, до 10 эталоновНет (отдельная модель Edit)Да, несколько эталонов
Прозрачный вывод RGBAДаДаНе раскрытНе раскрыт
Нативное разрешение2K (2048×2048)2K (2048×2048)1024×1024 в примерах1024×1024 в примерах
Рекомендации по оборудованиюНе раскрыты11 ГБ GGUF / 24 ГБ FP8 (Unsloth)Работает на 16 ГБ VRAM~29 ГБ VRAM, RTX 4090+
ЛицензияQwen Research LicenseQwen Research LicenseApache 2.0FLUX Non-Commercial
Qwen-Image-BenchНе раскрыт60,28 (по данным разработчика)Не раскрытНе раскрыт
Размещённый API0,1 юаня КНР/изображениеPro: 0,25 юаня КНР/изображениеНе раскрытAPI BFL

Ключевые выводы

  • Qwen-Image-2.1-Turbo сокращает число шагов устранения шума с 40 до 8 на той же архитектуре с 7B параметрами.
  • Один чекпойнт поддерживает генерацию изображений из текста в разрешении 2K, редактирование с несколькими эталонами и прозрачный вывод RGBA.
  • API стоит 0,1 юаня КНР за изображение — в 2,5 раза дешевле Pro.
  • На веса распространяется исследовательская лицензия, поэтому для коммерческого самостоятельного размещения требуется отдельное разрешение.
  • Специального бенчмарка для Turbo пока нет; базовая Qwen-Image-2.1 набирает 60,28 балла в Qwen-Image-Bench.

Посетите страницу ModelScope, страницу Hugging Face, API Pro и API Turbo. Вся заслуга принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Стоп! Вы пользуетесь Telegram? теперь вы также можете присоединиться к нам в Telegram.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости