---
title: "Qwen-Image-2.1：以 7B 生成組件統一圖像生成與編輯"
url: https://sammy.hk/qwen-image-2-1%ef%bc%9a%e4%bb%a5-7b-%e7%94%9f%e6%88%90%e7%b5%84%e4%bb%b6%e7%b5%b1%e4%b8%80%e5%9c%96%e5%83%8f%e7%94%9f%e6%88%90%e8%88%87%e7%b7%a8%e8%bc%af/
author: Ethan
published: 2026-09-21T15:41:00+08:00
modified: 2026-09-21T11:02:43+08:00
description: "阿里 Qwen 團隊於 2026 年 9 月 20 日開源 Qwen-Image-2.1，把文字生成圖像與圖像編輯統一在同一個模型之內，其視覺生成組件只有 7B 參數（32 層 Single-Stream DiT），並原生支援透明圖層的生成與編輯。[1][2] 架構與推理效率 Qwen-Image-2.1 的設計重點之…"
categories: [AI]
tags: [Qwen-Image-2.1, "人工智能", "圖像生成", "通義千問", "開源模型", "阿里"]
source: https://sammy.hk
---
![Qwen-Image-2.1：以 7B 生成組件統一圖像生成與編輯](https://sammy.hk/wp-content/uploads/2026/09/openrouter_google_gemini-3_1-flash-lite-image_20260921_105948_2bcb18a4.jpg)阿里 Qwen 團隊於 2026 年 9 月 20 日開源 Qwen-Image-2.1，把文字生成圖像與圖像編輯統一在同一個模型之內，其視覺生成組件只有 7B 參數（32 層 Single-Stream DiT），並原生支援透明圖層的生成與編輯。\[1\]\[2\]

## 架構與推理效率

Qwen-Image-2.1 的設計重點之一，是在保持圖像質素的同時壓縮推理成本。官方說明指模型採用混合粒度注意力（mixed-granularity attention）架構：文字（包括系統前綴與編輯指令）使用 token 層級的因果遮罩，圖像生成則使用 chunk 層級的遮罩；配合 KV cache 重用，輸入圖像與編輯指令可以視為靜態上下文，在第一步計算並快取，從而提升推理效率並降低記憶體用量。\[1\]

模型卡列出四個改進方向：架構緊湊而高效、原生透明與統一創建編輯、多樣化編輯能力，以及更真實的質感與美感（包括文字排版、人像打光與細節）。\[2\]

## 原生透明圖層

透明圖層是這次版本的主要新增能力。Qwen 團隊早前在 2025 年 12 月以獨立模型 Qwen-Image-Layered 支援透明圖像生成，Qwen-Image-2.1 則把此能力整合進統一模型，由提示自行決定輸出普通圖像或帶透明通道的圖像。\[1\]

能力範圍包括：直接由文字生成透明圖像、編輯透明圖層（例如改變主體表情而保留透明背景、替換透明層內文字），以及從 RGB 相片抽取主體成帶透明度的 RGBA 圖層，方便日後在設計與合成工作中重用。\[1\]

## 多重參考與局部編輯

編輯方面，模型支援最多十張參考圖，可以把多個主體與素材合成為一致的構圖，官方示範包括由六張人像合成團體照、由五張輸入（模特兒、服裝、鞋、袋、帽）合成完整造型，以及以十張傢俬圖生成室內配置。\[1\]

局部編輯支援三種指定方式：以不同顏色的圓圈標示多個區域、以手繪標註指出範圍，或另附遮罩並保留完整原圖。官方亦指出局部編輯可配合連續修改，把逐步改動的圖像串連成簡單動畫。\[1\] 此外，模型在人像身分與產品一致性上有所改進，令同一人物或產品在多次編輯後保持穩定。\[1\]

## 使用方式與授權

模型可透過 diffusers 的 `QwenImage21Pipeline` 載入，預設以 2048×2048、約 40 步推理，並提供七組長寬比選項（1:1、4:3、3:4、3:2、2:3、16:9、9:16），官方亦示範以 CPU offload 降低記憶體需求。\[2\]

須留意授權變動：Qwen-Image-2.1 採用 Qwen Research License Agreement，屬非商用授權，商用需要另行取得授權；此安排與早前 Qwen-Image 系列採用的 Apache 2.0 不同。開發者在把模型用於產品之前，應先閱讀授權條款。\[2\]\[3\]

## 參考資料

\[1\] [Qwen 官方網誌 — Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation](https://qwen.ai/blog?id=qwen-image-2.1)

\[2\] [Hugging Face — Qwen/Qwen-Image-2.1 模型卡](https://huggingface.co/Qwen/Qwen-Image-2.1)

\[3\] [Hugging Face — Qwen Research License Agreement](https://huggingface.co/Qwen/Qwen-Image-2.1/tree/main/LICENSE)

### 相關文章：

1. [揭開「Ox Alpha」之謎：智譜 Z.ai 的 GLM-5.3-Flash 如何以匿名之姿攻陷 OpenRouter](https://sammy.hk/%e6%8f%ad%e9%96%8b%e3%80%8cox-alpha%e3%80%8d%e4%b9%8b%e8%ac%8e%ef%bc%9a%e6%99%ba%e8%ad%9c-z-ai-%e7%9a%84-glm-5-3-flash-%e5%a6%82%e4%bd%95%e4%bb%a5%e5%8c%bf%e5%90%8d%e4%b9%8b%e5%a7%bf%e6%94%bb%e9%99%b7/ "揭開「Ox Alpha」之謎：智譜 Z.ai 的 GLM-5.3-Flash 如何以匿名之姿攻陷 OpenRouter")
2. [Nvidia 以 129 億美元收購 Hugging Face：「AI 的 GitHub」落入晶片巨頭手中](https://sammy.hk/nvidia-%e4%bb%a5-129-%e5%84%84%e7%be%8e%e5%85%83%e6%94%b6%e8%b3%bc-hugging-face%ef%bc%9a%e3%80%8cai-%e7%9a%84-github%e3%80%8d%e8%90%bd%e5%85%a5%e6%99%b6%e7%89%87%e5%b7%a8%e9%a0%ad%e6%89%8b%e4%b8%ad/ "Nvidia 以 129 億美元收購 Hugging Face：「AI 的 GitHub」落入晶片巨頭手中")
3. [開放權重 AI 成為矽谷最搶手資產：Stripe 收購 OpenRouter、Nvidia 重金押注 Poolside](https://sammy.hk/%e9%96%8b%e6%94%be%e6%ac%8a%e9%87%8d-ai-%e6%88%90%e7%82%ba%e7%9f%bd%e8%b0%b7%e6%9c%80%e6%90%b6%e6%89%8b%e8%b3%87%e7%94%a2%ef%bc%9astripe-%e6%94%b6%e8%b3%bc-openrouter%e3%80%81nvidia-%e9%87%8d%e9%87%91/ "開放權重 AI 成為矽谷最搶手資產：Stripe 收購 OpenRouter、Nvidia 重金押注 Poolside")
4. [DeepSeek 發佈 V4.1-Flash：MIT 授權開放權重、每百萬 token 低至 0.15 美元](https://sammy.hk/deepseek-%e7%99%bc%e4%bd%88-v4-1-flash%ef%bc%9amit-%e6%8e%88%e6%ac%8a%e9%96%8b%e6%94%be%e6%ac%8a%e9%87%8d%e3%80%81%e6%af%8f%e7%99%be%e8%90%ac-token-%e4%bd%8e%e8%87%b3-0-15-%e7%be%8e%e5%85%83/ "DeepSeek 發佈 V4.1-Flash：MIT 授權開放權重、每百萬 token 低至 0.15 美元")
