
上一篇實測 Qwen-Image-2.1 時,最有意思的兩個能力是「一張參考圖就能編輯」和「原生透明背景輸出」。當時各測各的,這篇把兩件事接在一起:給它一張頭像,一段九宮格指令,它直接吐出一張九格透明貼圖,切開就是九張可以丟進 LINE 的 PNG,中間不需要去背模型,也不需要 Photoshop。
我用六個 Qwen-Image-2.1 自己畫的角色跑了一輪,把過程中踩到的坑、最後定下來的句型、以及自動切格縮圖的工作流全部放上來。
快速結論
- 一段 prompt 就夠:把角色描述和九格動作填進固定句型,模型會畫出九格排版、每格一個表情、人物下方一句短語,而且格內背景是真的透明
- 關鍵在 prompt 怎麼寫,不在 ComfyUI 的設定:只套官方「透明背景」的寫法,會得到九張不透明卡片、只有格與格之間是透明的。要明說「沒有任何底板、卡片、邊框或底色,每一格內人物與文字以外全部透明」
- 文字用兩到四個字最穩,繁體中文可以直接寫,錯字率比其他模型低但不是零
- 十六宮格也做得到,解析度拉到 1536 以上,2048 文字最清楚,十六張剛好是 LINE 一組
- 多個角色同一格目前不可靠,人物的長相會變、不像同一個人,這篇只做單角色
- 授權是非商用,自用與練習沒問題,要上架販售請先確認 Qwen Research License
這篇要做出什麼
LINE 貼圖的規格:單張 PNG 最大 370×320 像素、透明背景、檔案 1MB 以內,一組 8、16、24、32 或 40 張,另外要一張 240×240 的主圖和一張 96×74 的分頁圖。
九宮格出九張、十六宮格出十六張,剛好對上「取八張」或「一組十六張」;兩張九宮格也能湊十六張。這篇的目標就是把「頭像」變成「符合規格、已經透明、已經切好」的一疊 PNG。
為什麼是 Qwen-Image-2.1
它是目前唯一同時滿足三件事的開源模型:
- 看著參考圖畫新的圖:頭像丟進去,它會保留髮型、配件、畫風,換成九種表情動作
- 畫圖的時候就把透明度一起畫出來:它的 VAE 多學了一個 alpha 通道,輸出直接是四通道的 PNG,不是先生白底再切
- 繁體中文寫得出來:上一篇 53 題測試裡它和 SenseNova 並列最穩,貼圖上的短語直接用繁體寫就好
我也拿同一批頭像試過 HiDream-O1、Qwen-Image-Edit-2511、JoyAI、Boogu、FireRed 這幾款編輯模型做同樣的九宮格。人物一致性和畫風保留都是 Qwen-Image-2.1 明顯較好,差距大到沒有評比的必要,所以這篇不做對照,專心把它的用法講清楚。
授權要先講:Qwen Research License 是非商用授權,跟上一代的 Apache-2.0 不同。自己用、練習、做給朋友都沒問題;要拿去 LINE Creators Market 上架販售,請先確認授權條款。
四個步驟
一、生一個角色
角色直接用 Qwen-Image-2.1 文生圖畫,白底、半身、正面,風格在這一步就決定好,後面的九宮格會沿用。例如:
扁平插畫風格,短髮、穿米色襯衫的年輕女上班族,半身正面看鏡頭,白色背景,簡潔線條,柔和配色

自己的照片、手繪角色、其他模型畫的圖也都可以當參考圖,重點是白底、主體清楚。
二、寫九宮格 prompt
這是整篇最重要的一段。下面這個句型直接複製,把「人物句」「風格句」和九格的「動作」「文字」換成你的:
This is an RGBA format image with transparency. 將圖片改成九宮格排版的貼圖,展示{人物句}的九種表情包,{風格句}。九個格子大小相同、整齊排成三行三列,不要把參考圖放大放在中間。整張圖只有人物與人物下方的黑色圓體文字,沒有任何底板、卡片、邊框或底色;每一格內人物與文字以外的所有區域都是完全透明的,不是白色也不是灰色。第一行第一格是{動作},文字是「{文字}」;第一行第二格是{動作},文字是「{文字}」;第一行第三格是{動作},文字是「{文字}」;第二行第一格是{動作},文字是「{文字}」;第二行第二格是{動作},文字是「{文字}」;第二行第三格是{動作},文字是「{文字}」;第三行第一格是{動作},文字是「{文字}」;第三行第二格是{動作},文字是「{文字}」;第三行第三格是{動作},文字是「{文字}」。The image has an alpha channel and a transparent background.
以男學生為例,人物句是「參考圖中戴圓框眼鏡的男學生」,風格句是「保留參考圖原本的畫風、配色與造型特徵」,九格是「不高興的表情/不想起床」「高興的動作/放學啦」「四仰八叉躺著/躺平啦」「振臂/奮鬥吧」「大笑/哈哈哈」「豎起大拇指/你好棒」「思考/思考人生」「生氣鼓腮/生氣啦」「害羞摀臉/傷心啦」。填好的完整範例、白邊變體和十六宮格版本都在文末的附錄,每一段都有一鍵複製。
三、直接輸出透明背景
在 ComfyUI 裡把頭像接到 TextEncodeQwenImage21 節點的第一張參考圖,prompt 貼進去,25 步、CFG 1、euler simple、resolution 1024,跑出來就是一張 1024×1024 的四通道 PNG。

上面這張圖是我為了讓透明看得出來,把成品鋪在灰白棋盤格上的樣子。你自己從 ComfyUI 存出來的 PNG 用看圖軟體打開,透明的地方會顯示成一片紫色,這是正常的:模型在透明區域填的顏色剛好是洋紅色,但那些像素已經標記成完全透明,貼到聊天室、簡報或任何背景上都不會看到紫色。想確認透明有沒有成功,用支援透明顯示的看圖軟體或圖片編輯器開,透明處會顯示成棋盤格。
四、切格、裁切、縮到規格
一張 1024 的九宮格切成九塊是 341 像素一格,比 LINE 的上限小,所以切完就是可以用的尺寸。我請 AI 寫了一條工作流把後面的事全包:縮到 1023 讓三整除、等分九格、每格依 alpha 找到內容邊界裁掉多餘透明、四周留邊、等比縮到 370×320 以內、存成九張 PNG。

工作流檔在文末下載,載入後只要換參考圖和 prompt。
prompt 為什麼要這樣寫
這一段是我踩坑的紀錄,看完就知道每一句在防什麼。
第一次:在透明句型裡保留「白色背景」。原本做不透明九宮格的 prompt 開頭是「將圖片改成以白色為背景」,我只在前面加上官方範本的第一句「This is an RGBA format image with transparency.」、後面加上最後一句「The image has an alpha channel and a transparent background.」,中間一個字沒改。結果是九張白底卡片,透明的只有卡片之間的縫。

第二次:把「白色背景」改成「透明背景」。以為這樣就好,結果更糟:模型把參考圖的畫布底色整塊搬進每一格,每格還是一張不透明卡片,透明像素只有一成。

第三次:套官方去背範本的句子「Remove the background, and output a PNG image」加上九格描述。整張完全不透明,透明像素是零。這句對單一物件有效,對九宮格排版沒有用。

成功的寫法是把「不要什麼」講死:沒有任何底板、卡片、邊框或底色;並且指定範圍:每一格內人物與文字以外的所有區域都是完全透明的,不是白色也不是灰色。加上這兩句之後,透明像素從一成跳到五成以上,九格裡的人物和文字乾淨地浮在透明底上。

還有一個變體。如果想要每張貼圖外圍有一圈白色描邊,把開頭改成英文的「nine die-cut stickers」寫法,模型會自己畫出貼紙的白邊,其他句子不變。

兩個一起記住:透明句型裡不能出現任何背景顏色,「透明」要指到格內而不是整張圖。
還有一種失敗跟透明無關,是版面。水彩的橘貓和手繪線條的老奶奶這兩張參考圖比較像「一幅畫」,模型第一次都把參考圖放大擺在正中央,八張小貼圖圍在四周,透明是透明了,但切格會切到主圖。

修法是在風格句後面加一句「九個格子大小相同、整齊排成三行三列,不要把參考圖放大放在中間」,兩組都是加了之後第一次就排成正常的九宮格。扁平插畫、Q 版、黏土這類本來就像貼圖的參考圖沒遇到這個問題,但這句加著沒壞處,下載的 prompt 裡已經放進去。
六組範例
六個角色、六種主題,每組左邊是頭像,右邊是直接輸出的透明九宮格,下方是切好的九張。全部同一個句型,只換人物句、風格句和九格內容。
女上班族:上班族日常
扁平插畫風格。九句:加班好累、開心下班、躺平休息、努力工作、好開心、加油啊、思考計畫、被主管罵、好傷心。

男學生:學生日常
Q 版二頭身。九句就是本文的範例 prompt。

柴犬:寵物語錄
圓潤卡通。九句:散步去、吃飯了、裝死中、搖尾巴、汪!、討摸摸、發呆中、生氣了、好委屈。動物角色的動作要寫得具體,例如「叼牽繩」「翻肚躺平」,只寫情緒它會用人的姿勢演。

橘貓:療癒語錄
水彩風格。九句:早安、晚安、謝謝、加油、OK、好累、收到、愛你、晚點聊。這一組的短語最短,錯字最少,適合當第一組練習。

老奶奶:長輩問候
手繪線條。九句:吃飽沒、早安、平安、保重、加油、謝謝、好棒、想你、晚安。

小機器人:工程師日常
黏土質感。九句:有bug、部署中、喝咖啡、開會中、下班了、崩潰、修好了、再跑一次、收工。中英混排它也寫得出來。

十六宮格
LINE 一組十六張,直接用四行四列的十六宮格更省事。句型只改三個地方:「九宮格」改成「十六宮格(4 行 4 列)」、「九種」改「十六種」、格子句寫到第四行第四格。
解析度要跟著拉高:1024 切成十六格每格只有 256 像素,文字會糊掉。設 1536 就能用,設 2048 的文字最清楚,它本來就是原生 2K 的模型。


十六句是九句加上早安、晚安、謝謝、加油、OK、好累、收到。這張 2048 的版本模型自己在每張貼圖外圍畫了白色描邊,1536 的版本沒有;同一個 seed 換解析度構圖會變,這是它的特性,不是錯。
進階:讓 AI 每次出不同的九句
同一個角色要做第二組、第三組貼圖,九句和動作每次自己想很花時間。工作流裡有一個場景接了本機的視覺語言模型(Ollama 上的 Qwen3-VL),它看著頭像、依你給的一句主題,把九組「動作+短語」填進固定的 prompt 骨架,骨架其他字一個都不准動。
給它「上班族日常」,它出的是:加班好累、開心下班、躺平休息、努力工作、好開心、加油啊、思考計畫、被主管罵、好傷心。就是六組範例的第一組。
兩個要注意的地方:短語超過四個字錯字率會升高,要在指令裡限制字數;它偶爾會吐簡體字,指令要寫明台灣用語。
限制與坑
- 文字錯字與簡體字:兩到四個字最穩,五個字以上開始出錯。另一種錯是混進簡體字,柴犬那組的「討摸摸」「搖尾巴」就被寫成簡體的討與搖。每次出圖檢查一下,有錯字的話換一個隨機種子(seed)重新生成一次就好,同一個 prompt 每換一次 seed 就是一張新的圖
- 兩個角色同一格要看組合:要兩個角色一起出現,句子得寫死「每一格都同時畫出兩個角色並排,左邊是誰、右邊是誰,九格每格都必須兩者都在」。人加寵物這種差異大的組合排得出來,但兩個人物的話,我實測人物的長相會變、不像參考圖的本人,細節也變粗糙,目前不建議拿來做正式貼圖

- 髮絲邊緣:原生透明的邊緣在髮絲、毛髮上不如專用去背模型細,貼圖尺寸小看不出來,放大用途要另外考慮
- 透明區是洋紅色:原始 PNG 直接看是紫底,不是壞掉。不透明的圖它也會給 alpha,值接近但不是 255,要純 RGB 的話轉一次
- 兩個人一起做表情:即使兩人都在同一格,通常只有一個在演,另一個維持參考圖的表情
- 文字位置偶爾跑掉:少數格子文字會歪或貼在人物旁邊,裁切時會一起保留,看得順眼就用
想自己跑
| 檔案 | 下載 | 放置位置 |
| qwen_image_2.1_bf16.safetensors(約 14GB;另有 int8_convrot 版約 7GB) | Hugging Face Comfy-Org/Qwen-Image-2.1 | models/diffusion_models/ |
| qwen3vl_8b_int8_convrot.safetensors(文字編碼器,約 9GB) | 同上 | models/text_encoders/ |
| qwen_image_2.1_vae_bf16.safetensors(RGBA VAE,約 700MB) | 同上 | models/vae/ |
ComfyUI 0.37.0 以上原生支援。工作流用到的切格與裁切節點來自 ComfyUI-KJNodes 和 ComfyUI-RMBG 兩個節點包,用 Manager 裝。
下載:工作流 JSON,三個場景:直接輸出透明背景(本文用的)、白底加專用去背、AI 改寫九句;載入後換參考圖和 prompt 即可。prompt 全文在下面的附錄。
附錄:prompt 全文
設定都一樣:25 步、CFG 1、euler simple、resolution 1024(十六宮格用 1536 或 2048),參考圖接 TextEncodeQwenImage21 的第一張圖。
透明九宮格,填好的完整範例(男學生)
This is an RGBA format image with transparency. 將圖片改成九宮格排版的貼圖,展示參考圖中戴圓框眼鏡的男學生的九種表情包,保留參考圖原本的畫風、配色與造型特徵。九個格子大小相同、整齊排成三行三列,不要把參考圖放大放在中間。整張圖只有人物與人物下方的黑色圓體文字,沒有任何底板、卡片、邊框或底色;每一格內人物與文字以外的所有區域都是完全透明的,不是白色也不是灰色。第一行第一格是不高興的表情,文字是「不想起床」;第一行第二格是高興的動作,文字是「放學啦」;第一行第三格是四仰八叉躺著的動作,文字是「躺平啦」;第二行第一格是振臂的動作,文字是「奮鬥吧」;第二行第二格是大笑的表情,文字是「哈哈哈」;第二行第三格是豎起大拇指的動作,文字是「你好棒」;第三行第一格是思考的動作,文字是「思考人生」;第三行第二格是生氣鼓腮的動作,文字是「生氣啦」;第三行第三格是害羞摀臉的動作,文字是「傷心啦」。The image has an alpha channel and a transparent background.
白色貼紙描邊變體
想要每張貼圖外圍有一圈白邊,把開頭換成英文的 die-cut 寫法,九格句照舊:
This is an RGBA format image with transparency. A sheet of nine die-cut stickers of the character from the reference image, arranged in a 3x3 layout. Each sticker is only the character and a short Traditional Chinese caption below in bold black rounded font; there are NO cards, NO panels, NO frames, NO background color of any kind. Everything outside the character and the text is fully transparent, including the inside of every cell. {九格句}. The image has an alpha channel and a transparent background.
十六宮格
This is an RGBA format image with transparency. 將圖片改成十六宮格(4 行 4 列)排版的貼圖,展示{人物句}的十六種表情包,{風格句}。十六個格子大小相同、整齊排成四行四列,不要把參考圖放大放在中間。整張圖只有人物與人物下方的黑色圓體文字,沒有任何底板、卡片、邊框或底色;每一格內人物與文字以外的所有區域都是完全透明的,不是白色也不是灰色。第一行第一格是{動作},文字是「{文字}」;第一行第二格是{動作},文字是「{文字}」;第一行第三格是{動作},文字是「{文字}」;第一行第四格是{動作},文字是「{文字}」;第二行第一格是{動作},文字是「{文字}」;第二行第二格是{動作},文字是「{文字}」;第二行第三格是{動作},文字是「{文字}」;第二行第四格是{動作},文字是「{文字}」;第三行第一格是{動作},文字是「{文字}」;第三行第二格是{動作},文字是「{文字}」;第三行第三格是{動作},文字是「{文字}」;第三行第四格是{動作},文字是「{文字}」;第四行第一格是{動作},文字是「{文字}」;第四行第二格是{動作},文字是「{文字}」;第四行第三格是{動作},文字是「{文字}」;第四行第四格是{動作},文字是「{文字}」。The image has an alpha channel and a transparent background.
不透明白底版(要另外去背時用)
將參考圖中的人物改成九宮格排版的貼圖,白色背景,展示{人物句}的九種表情包,{風格句}。第一行第一格是{動作},文字是「{文字}」;……第三行第三格是{動作},文字是「{文字}」。文字在人物下方,黑色圓體字。
讓 AI 幫你出九句(給視覺語言模型的指令)
看著頭像判斷人物性別年齡穿著,依主題「{主題}」產生九組「動作+貼圖短語」,短語 2 到 4 個繁體中文字(台灣用語,不用簡體,九種情緒不重複),動作不超過 15 字。只准把結果填進下面骨架,其餘一字不改,只輸出最終文字: 將參考圖中的人物改成九宮格排版的貼圖,白色背景,展示{人物句}的九種表情包,{風格句}。第一行第一格是{動作},文字是「{短語}」;……第三行第三格是{動作},文字是「{短語}」。文字在人物下方,黑色圓體字。
相關文章
- Qwen-Image-2.1 實測:透明輸出、多參考編輯、原生 2K,官方宣稱本機驗證對了幾件 — 本文用到的透明輸出與參考圖編輯能力的實測與模型設定
- ComfyUI 去背怎麼選 — 髮絲邊緣要更細時的專用去背路線
- 繁體中文 AI 生圖測試 Prompt:53 組全公開 — 為什麼貼圖上的繁體字可以直接寫



