
阿里 Qwen 團隊於 2026 年 9 月 20 日開源 Qwen-Image-2.1,把文字生成圖像與圖像編輯統一在同一個模型之內,其視覺生成組件只有 7B 參數(32 層 Single-Stream DiT),並原生支援透明圖層的生成與編輯。[1][2]
架構與推理效率
Qwen-Image-2.1 的設計重點之一,是在保持圖像質素的同時壓縮推理成本。官方說明指模型採用混合粒度注意力(mixed-granularity attention)架構:文字(包括系統前綴與編輯指令)使用 token 層級的因果遮罩,圖像生成則使用 chunk 層級的遮罩;配合 KV cache 重用,輸入圖像與編輯指令可以視為靜態上下文,在第一步計算並快取,從而提升推理效率並降低記憶體用量。[1]
模型卡列出四個改進方向:架構緊湊而高效、原生透明與統一創建編輯、多樣化編輯能力,以及更真實的質感與美感(包括文字排版、人像打光與細節)。[2]
原生透明圖層
透明圖層是這次版本的主要新增能力。Qwen 團隊早前在 2025 年 12 月以獨立模型 Qwen-Image-Layered 支援透明圖像生成,Qwen-Image-2.1 則把此能力整合進統一模型,由提示自行決定輸出普通圖像或帶透明通道的圖像。[1]
能力範圍包括:直接由文字生成透明圖像、編輯透明圖層(例如改變主體表情而保留透明背景、替換透明層內文字),以及從 RGB 相片抽取主體成帶透明度的 RGBA 圖層,方便日後在設計與合成工作中重用。[1]
多重參考與局部編輯
編輯方面,模型支援最多十張參考圖,可以把多個主體與素材合成為一致的構圖,官方示範包括由六張人像合成團體照、由五張輸入(模特兒、服裝、鞋、袋、帽)合成完整造型,以及以十張傢俬圖生成室內配置。[1]
局部編輯支援三種指定方式:以不同顏色的圓圈標示多個區域、以手繪標註指出範圍,或另附遮罩並保留完整原圖。官方亦指出局部編輯可配合連續修改,把逐步改動的圖像串連成簡單動畫。[1] 此外,模型在人像身分與產品一致性上有所改進,令同一人物或產品在多次編輯後保持穩定。[1]
使用方式與授權
模型可透過 diffusers 的 QwenImage21Pipeline 載入,預設以 2048×2048、約 40 步推理,並提供七組長寬比選項(1:1、4:3、3:4、3:2、2:3、16:9、9:16),官方亦示範以 CPU offload 降低記憶體需求。[2]
須留意授權變動:Qwen-Image-2.1 採用 Qwen Research License Agreement,屬非商用授權,商用需要另行取得授權;此安排與早前 Qwen-Image 系列採用的 Apache 2.0 不同。開發者在把模型用於產品之前,應先閱讀授權條款。[2][3]
參考資料
[1] Qwen 官方網誌 — Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation