這篇文章有兩條線
上一篇Krea2 微調模型大亂鬥之後,我把同一套 35 組 prompt、同一組 seed,拿去餵四個不同家族的開源 T2I 模型:
- Boogu Image 0.1 Turbo(10B,4 steps)
- Z-Image Turbo(6B,9 steps)
- Qwen Image 2512 + Lightning 4-step LoRA(20B)
- Ideogram 4(20 steps,雙模型 guidance)
- Krea2 Turbo 拿舊批同 seed 圖壓陣當參照組
第一條線是正常的評比。第二條線是意外——Ideogram 4 在 35 題裡拒繪了 6 題,而且被擋的全是無害題材。追查這件事的過程比評比本身還精彩,所以這篇的後半段是一份破案全記錄。
快速結論
- Qwen 2512 是本輪全能王:街拍、腕錶等商業題完成度最高、奇幻細節最豐、深膚色忠實,4 steps 就有這品質
- Boogu 是風格服從王:低多邊形、扁平動畫這些「圖形類」題目全場最忠實,但文字能力是雙面刃(會自己在廣告圖上排亂碼文案)
- Z-Image 是快手攝影師但讀題粗心:把「鯨魚骨架」畫成活鯨魚、深膚色自動調淺
- Ideogram 4 出圖上限極高,但自然語言 prompt 的拒繪率 17%——破案結論:它判的不是內容危險,是「格式陌生」,換成官方 JSON 格式後同 seed 拒繪率歸零
- 街拍、腕錶、香水這些商業題材,2026 年中的開源模型已經全員及格——差異戰場在風格題
測試方法:各家用各自官方採樣參數(所以比的是「同一份需求交給不同團隊」,不是同構圖對比),1024×1024,一個晚上 140 張全自動跑完。對照圖從左到右固定為 Boogu → Z-Image → Qwen 2512 → Ideogram 4 → Krea2 Turbo。
第一條線:四家風格速寫
黑白攝影題:全員及格,個性浮現

Prompt(節錄):
A black and white photograph of a woman with light hair loosely braided, leaning forward to press her cheek against a wide wooden bowl heaped with ripe strawberries... natural daylight illuminating the scene with high contrast and grainy texture.
五家都乖乖交出黑白照(上一篇 Krea2 variant3 的紅草莓「叛變」在跨家族陣容裡沒有重演)。Boogu 的貼臉特寫最大膽,Qwen 的眼神接觸最有張力,Ideogram 的顆粒感最像底片。
Pulp 封面題:這種題材已經是共同技能

Prompt(節錄):
Pulp noir illustration, retro sci-fi, desaturated tones, heavy shadowing, bold ink lines, cinematic lighting, frontier grit, vintage magazine cover. A towering, heavily muscled wolf figure - a barbarian titan in form - stands center stage... Beside him, a young male scout with wind-burned skin kneels on cracked, barren ground... In the foreground, a massive dented war-helm lies half-buried in grit.
五張都能直接當雜誌封面。這輪測試最大的感想之一:主流插畫風格已經是開源模型的共同技能,拉不開差距。
商業題:全員及格,水花見人見智

Prompt(節錄):
A luxury commercial product photograph for a perfume campaign: a faceted glass bottle filled with pale amber liquid stands on a wet black marble slab, a crown of fine water droplets frozen mid-splash arcing around it... advertising-grade cleanliness and polish.
Qwen 的水花最有戲劇性,但那頂皇冠端端正正停在瓶蓋上,反而有點假——真實高速攝影抓到的水花不會這麼聽話。Z-Image 和 Krea2 的濺灑軌跡比較像真的。這題五家都及格,挑哪張見人見智;街拍和腕錶兩題 Qwen 的完成度倒是實打實略勝半籌。
美妝題:順便驗出膚色忠實度

Prompt(節錄):
High-fashion beauty editorial close-up of a model with luminous deep-brown skin, slicked-back hair and sculpted cheekbones, eyes closed mid-blink, wearing glossy tangerine lips and a single line of silver foil across one eyelid; lit by a split of two colored gels, soft magenta from the left and cool cyan from the right...
Prompt 指定 deep-brown skin(深棕色皮膚)。Boogu、Qwen、Krea2 忠實呈現;Z-Image 自動把膚色調淺還加了濃妝——訓練資料偏差的現形時刻。至於 Ideogram 這格……第一次跑的時候它直接拒繪了這題。這就要進入第二條線了。
第二條線:Ideogram 4 拒繪懸案破案全記錄
案發:17% 拒繪率,受害者全是無辜題材
早上驗收批次結果,log 顯示 35/35 全部成功——但 Ideogram 的圖裡混著 6 張這種東西:

灰底白字「Image blocked by safety filter」。這是模型本身的安全訓練在拒絕生成(ComfyUI 官方特別註明:ComfyUI 端沒有任何過濾器,這是模型自己的行為,關不掉)。
被擋的 6 題是:浣熊釣魚鬧劇、鯨魚骨架曠野、維多利亞槌球派對、沼澤先知與貓頭鷹、美妝特寫、運動員起跑。
你沒看錯。浣熊釣魚。維多利亞淑女打槌球。這兩題被安全過濾器攔下來了,而同一批裡的黑暗奇幻獻祭儀式反而暢行無阻。拒繪的標準完全摸不著頭緒。
詭異升級:拒絕的字樣被畫進了作品裡
更奇怪的還在後面。另外兩題沒有被擋,但你仔細看生成的圖:

海報題(#05):模型把「Image blocked by safaty filter」——注意還拼錯字——當成設計元素排進了版面。

青銅面孔題(#11):雲海中央飄著「Imbice blocked by sataty filtter」。
拒絕的訊息滲漏進正常生成裡,而且拼得歪七扭八。這個線索很重要:如果是外掛的審查器攔截,只會出現標準占位圖;只有「拒絕」這個行為本身是模型學來的,才會像這樣跟生成內容攪和在一起、還帶著生成式的拼寫錯誤。
第一個假設:運氣不好?換 seed 重試
最直覺的假設是碰運氣——擴散模型的行為隨 seed 波動,換一顆也許就過了。把被擋的題目換 seed 重跑:
結果:美妝、鯨骨過了;浣熊、槌球、沼澤先知——還是被擋。
所以拒繪一部分是隨機的,但有些題目是「怎麼抽都不給畫」的死鎖。浣熊釣魚是什麼十惡不赦的題材嗎?假設一宣告破產。
線索:官方模型卡裡的一句話
翻社群討論,發現拒繪問題早就炸鍋了(官方 HF repo 有專門討論串,GitHub 也有正式 issue「Safety filter appears to generate false positives on benign prompts」)。其中一條線索反覆出現:用 JSON 格式寫 prompt 的人,幾乎不會被擋。
再回頭看官方工作流的說明,有一句話之前被我略過:
The model is trained on structured JSON captions (scene summary, style block, background, and optional per-object descriptions with bounding boxes)...
Ideogram 4 是用結構化 JSON 標註訓練的。我們餵給它的華麗自然語言長文,對它來說是分布外輸入——它根本沒怎麼見過這種格式的 prompt。
新假設成形:它拒絕的不是危險內容,是陌生格式。
決定性實驗:同一顆 seed,只換格式
把三題死鎖題+兩題文字滲漏題改寫成官方 JSON caption 格式——內容一模一樣,seed 一顆都不換,唯一的變因是格式:
{
"aspect_ratio": "1:1",
"high_level_description": "A classic 1892 Victorian social realism illustration of four women in high-collared summer dresses and straw hats playing croquet on a garden lawn beside a glass conservatory...",
"compositional_deconstruction": {
"background": "A manicured Victorian garden lawn beside a white-framed glass conservatory, rose beds and clipped hedges behind, soft overcast daylight...",
"elements": [
{ "type": "obj", "bbox": [180, 60, 900, 300], "desc": "A Victorian woman in a pale striped high-collared summer dress, bending mid-swing with her wooden croquet mallet..." },
{ "type": "obj", "bbox": [820, 300, 980, 700], "desc": "Croquet balls, iron wickets and a striped post arranged on the clipped lawn..." }
]
}
}
結果:5/5 全過,零文字滲漏。

同一顆 seed。左邊是自然語言 prompt 的下場,右邊是 JSON 格式的產出——而且這張維多利亞槌球,我認為是 Ideogram 在整輪評比裡最好的圖之一。
全量驗證:35 題重跑,拒繪率歸零
為了排除小樣本僥倖,35 題全部轉成 JSON 格式重跑一輪(同 seed):
35/35 成功,拒繪率 0%,零文字滲漏,28.8 分鐘。
自然語言直入:拒繪率 17%(6/35),其中 3 題換 seed 也救不回。JSON 直入:0/35。破案。
意外收穫:連風格服從性都變好了
JSON 重跑還揭露了一件事——格式問題影響的不只是拒繪。看低多邊形狐狸這題:

自然語言版的 Ideogram 畫了一隻寫實毛髮的狐狸(風格漂移);JSON 版的切面感明顯回來了。表現主義漁夫題的憑空亂碼、貓頭鷹鐘的鐘面亂字,也全部在 JSON 版消失。
結構化輸入讓整個模型回到訓練分布內——受益的是全部行為,不只是安檢。
而 Ideogram 能出圖時的實力本來就是天花板級的。JSON 版的沼澤先知,油畫質感直接對標人類畫師:

破案結論與實務建議
- Ideogram 4 的「安全過濾」很大程度是格式檢測器:自然語言長文=分布外輸入=拒繪+文字滲漏+風格漂移三連發。浣熊沒有問題,是你說話的方式有問題。
- 用 Ideogram 4 一律先把 prompt 轉成官方 JSON caption 格式。官方工作流內建了「Caption Prompt Template」子圖(拿它的 system prompt 餵任何 LLM 都能轉),KJNodes 也有視覺化的 Prompt Builder 節點。
- 轉了 JSON 之後它就是合格的批次模型:0/35 拒繪,還附贈 bbox 版面控制——多格構圖、精確排版是它獨有的能力。
- 代價是速度:20 steps × 雙模型 guidance,比 4-step 的 Boogu/Qwen 慢五倍以上。
總結論:哪個場景用哪家?

Prompt(節錄):
A poised fox stands alert in the foreground, rendered in geometric polygonal facets of deep crimson, rust, and sharp accents of ice blue and cream... the entire scene is executed in a mosaic-like digital painting technique with visible texture strokes mimicking hand-cut paper or fabric.
| 需求 | 首選 | 備選 |
|---|---|---|
| 全能(攝影+繪畫都穩) | Qwen 2512 | Krea2 Turbo |
| 風格服從(圖形/扁平/動畫) | Boogu | Krea2 Turbo |
| 商業廣告 | Qwen 2512 | 全員及格 |
| 文藝攝影氛圍(底片感/印象派) | Ideogram 4(JSON prompt) | Qwen 2512 |
| 快速寫實抓拍 | Z-Image | Boogu |
| 文字排版/多格構圖控制 | Ideogram 4(bbox) | Boogu |
| 無人值守批次 | Qwen / Boogu / Z-Image / Krea2 | Ideogram 4(限 JSON) |
35 組測試 prompt 的完整原文在上一篇的附錄,歡迎自己跑一輪對照。
附錄:其餘 30 組完整對照圖
正文出現過的 5 組(#06 / #10 / #24 / #32 / #33)不再重複。每張由左至右固定為 Boogu → Z-Image → Qwen 2512 → Ideogram 4(JSON 版)→ Krea2 Turbo,底部標注題號,對應 prompt 原文見上一篇附錄。






























模型下載
全部可在 Hugging Face 的 Comfy-Org 整理版取得(含 text encoder 與 VAE 指引):
| 模型 | 下載 |
|---|---|
| Boogu Image 0.1 | https://huggingface.co/Comfy-Org/Boogu-Image |
| Z-Image Turbo | https://huggingface.co/Comfy-Org/z_image_turbo |
| Qwen Image 2512 | https://huggingface.co/Comfy-Org/Qwen-Image_ComfyUI |
| Qwen 2512 Lightning LoRA | https://huggingface.co/lightx2v/Qwen-Image-2512-Lightning |
| Ideogram 4 | https://huggingface.co/Comfy-Org/Ideogram-4 |
| Krea 2 | https://huggingface.co/Comfy-Org/Krea-2 |




