這次的玩法:讓 Claude 當總指揮
上一篇〈Krea2 微調模型大亂鬥〉我用 35 組 prompt 測了本地的開源模型。這次同一套 prompt 不換,換一個玩法:我把整件事交給 Claude,讓它寫好腳本,去指揮我電腦裡另外三個 AI 的命令列工具生圖——
- Codex(ChatGPT 訂閱附的)
- Antigravity(Gemini 訂閱附的)
- Grok
這三家都是訂閱裡本來就附的功能,不用再另外付 API 的錢。整個晚上 Claude 自己跑完 105 張圖,我隔天起來看結果就好。
不過先說它們共同的限制:都不能固定 seed、也不能指定精確的圖片尺寸。所以這輪沒辦法像上一篇那樣同 seed 逐張對照,比的是:同一段 prompt,誰交出來的圖更好。
快速結論
- Codex 最聽話:prompt 裡寫的每一個要求,它幾乎都會做到。要幫客戶做圖、每個細節都不能漏的時候,選它最保險。
- Antigravity 出圖最快(20 秒一張),但不穩定:35 張裡有 4 張莫名其妙畫壞,變成一堆色塊。神奇的是,同樣的 prompt 重新生一次就完全正常,而且品質很好。查了才知道它背後是新的輕量模型
gemini-3.1-flash-image。- Grok 是我心中的黑馬:盲測時我把 8 組的票投給它。但它有個壞習慣——愛在圖裡加沒人要求的文字(雜誌刊頭、船名、品牌字),而且常常拼錯。
- 我的「好看」評分和 Claude 的「聽話」評分,一致率 68%。意見不同的 16 組有個共同點:全部都是 Claude 選 Codex、而我把票投給別家。
測試方式
- 同一套 35 組 prompt:涵蓋插畫、攝影、人像、商業廣告、超現實等風格,跟上一篇開源模型測試用的完全相同。
- 每組每家只生一張:不重生、不挑圖。對三家都公平,也最接近平常「隨手請它出一張圖」的真實體驗。
- 我先盲測:Claude 做了一個打分頁面,我在不知道它怎麼評的情況下,每組選出我主觀覺得最好看的一張。
- Claude 用另一套標準評:它逐項核對 prompt——該有的東西有沒有畫出來、位置對不對、指定的風格像不像。選完才互相對答案。
兩份成績單
| Codex | Grok | Antigravity | 平手 | 都不行 | |
|---|---|---|---|---|---|
| 我(主觀好看) | 16 | 8 | 4 | 6 | 1 |
| Claude(照 prompt 程度) | 30 | 3 | 2 | — | — |
兩邊的排名順序一樣:Codex 第一、Grok 第二、Antigravity 第三。但票數差很多。
有趣的是意見不同的那 16 組:每一組都是 Claude 選 Codex,而我選了別家,反過來的情況只有一組。想了想其實很合理——Claude 在幫 prompt 打勾,Codex 每個要求都做到,勾勾最多;但每個細節都做對,不代表那張圖就最好看。我有 6 組直接給平手,因為光看圖真的分不出高下,差距是在逐項對答案的時候才拉開的。
反過來說也成立:Claude 願意把票投給 Codex 以外的那 5 組,其中 4 組我盲測時也選了同一家。連最挑剔的評審都改投別家的時候,那張圖通常是真的好。
35 組全部看圖
每張圖由左到右是 Codex、Antigravity、Grok。有感想的我寫幾句,其他的直接看圖。
#01 碼頭上的浣熊

Prompt 要求一個畫面塞三隻浣熊:釣到大魚的、偷三明治的、被釣線纏住的。三家都把三隻都畫出來了,但只有 Codex 同時做到「大魚離水、雙手握竿、水花飛濺」,毛髮和晨光也最細。這組我和 Claude 都選 Codex。
#02 沙漠巨獸白骨

#03 裂開的漆面具

#04 維多利亞槌球聚會

這組我給了「都不行」——三張都沒有真的長成 prompt 要的那種 19 世紀老插畫。
#05 向日葵編輯海報

#06 狼戰士雜誌封面

#07 雨街上的行人

我和 Claude 都選 Grok:整排街燈往遠處延伸、紫灰色的黎明天空、下襬沾著濕楓葉,它把整個氛圍做出來了。
#08 百葉窗光影人像

這組的重點是「百葉窗的光影要打在人的臉和身上」。只有 Grok 真的把條紋光影投在手臂和衣服上。Codex 那張其實最漂亮,但條紋只落在牆上,重點沒做到。我和 Claude 都投 Grok。
#09 打字機上的小貓

#10 草莓碗

#11 青銅面孔

Antigravity 這組畫壞了(變成扁平的色塊圖),是後面「翻車事件」的四張之一。
#12 蘭花遮眼

#13 巨鴉之首

#14 老漁夫

Prompt 指定要「像一幅顏料龜裂的老油畫」。Grok 交出來的真的是一張油畫——厚厚的筆觸、刮痕、剝落的顏料;Codex 畫得最精緻,但本質上是一張超寫實的黑白照片,題目要的質感沒做到。這裡藏著 Codex 的一個固定弱點:你叫它畫畫,它常常忍不住給你拍照。
#15 銅紅短髮的女子

35 組裡唯一一組立場對調的:prompt 要求畫面裡要有墨水塗鴉和拼貼碎片,Antigravity 真的貼了報紙、畫了塗鴉線(最符合題目,Claude 選它);但我盲測選了 Codex——它漏掉這些元素,可是畫得最美。
#16 沼澤先知

這組 prompt 寫得像規格書:五隻貓頭鷹排成半圓、其中一隻叼著鑰匙、傾倒的石盆⋯⋯全部指定死。只有 Codex 一項一項照做。要求寫得越細,它越強。
#17 復古旗袍與紙傘

#18 銅絲面紗

#19 霧中漁船

#20 亞麻襯衫青年

#21 地中海小巷

#22 溫柔凝視

#23 蒸汽龐克飛行員

#24 幾何狐狸與滿月

#25 四格側臉女士

題目要求四格從「寫實照片」一路變化到「抽象構成」。Codex 的四格變化最完整(Claude 選它);我選了 Grok,它嚴格說沒答對題——四格都還是具象插畫——但每一格都順眼。Antigravity 第一次生成只交出色塊(也是翻車四張之一),重生成的版本反而是我心中全場最佳。
#26 機器人騎靈緹犬

#27 程式碼組成的臉

#28 屋頂上的佛朗明哥

#29 玻璃蓮花

Antigravity 的主場。題目要求從斜上方俯瞰巨大的水晶蓮花、四片翅膀的守護者、掌心的光流飄向遠方的艦隊——只有它把這整個故事串起來。動畫感的場景是它最拿手的。我和 Claude 都選它。
#30 貓頭鷹咕咕鐘

#31 街頭時尚抓拍

#32 香水廣告

商業攝影類(香水、美妝、運動、腕錶)幾乎都是 Codex 拿下。決定勝負的常常不是美感,而是「能不能直接拿去用」:水花剛好環繞瓶身、旁邊留白給文案、打光乾淨。這些寫在 prompt 裡的要求,它是真的當一回事。
#33 美妝雜誌封面

#34 運動品牌廣告

#35 腕錶廣告

Prompt 指定「緊貼手腕的特寫」。Codex 是唯一守規矩的,Claude 選它;但我選了 Antigravity 拉遠的半身構圖——它違反了題目,氛圍卻是三張裡最好的。幫客戶做圖的話 Codex 才對,自己欣賞的話,規則沒那麼重要。
Antigravity 的翻車事件:畫壞了,重生一次就好

批次跑完我發現 Antigravity 有 4 張很怪:有的變成一堆扁平色塊,有的近乎全黑。本來以為是某些題目它做不來,結果同樣四組 prompt 重新生一次——四張全部正常,其中兩張還好到可以跟該組的冠軍比(上圖:上排是第一次,下排是重新生成)。
所以這不是「哪類題目它不會」,而是大約一成多的機率隨機畫壞,跟題目無關。加上它一張只要 20 秒,正確的用法就是:同一個 prompt 連生兩三張,挑最好的那張。
順便把它的身分查清楚了:Antigravity 生圖實際用的模型是 gemini-3.1-flash-image(從執行紀錄裡查到的)——是速度優先的輕量新模型,不是大家熟悉的 Nano Banana Pro。這解釋了它為什麼快、也解釋了它為什麼不穩。
速度與尺寸
| 一張要多久(中位數) | 圖片尺寸 | |
|---|---|---|
| Codex | 約 160 秒 | 多為 1024×1536 / 1536×1024,穩定 |
| Antigravity | 約 60 秒(最快 16 秒) | 768×768 到 1817×866,隨題目變動 |
| Grok | 約 240 秒(最慢一張跑了 12 分鐘) | 不固定 |
三家都不能固定 seed。需要固定 seed 做嚴謹比較、或需要精確控制尺寸的話,還是得用本地的開源模型。
所以怎麼選?
| 需求 | 選擇 |
|---|---|
| 幫客戶做圖、要求一項都不能漏 | Codex——最聽話 |
| 自己創作、重氛圍重質感 | Antigravity——連生幾張挑一張,20 秒一張不心疼 |
| 要油畫、手繪那種畫的質感 | Grok——最不會把「畫」做成「照片」 |
| 動畫風格、有故事性的場景 | Antigravity |
| 圖裡要出現正確的文字 | 三家都別太指望,Grok 還會自己加錯字 |
| 要固定 seed、要精確尺寸 | 本地開源模型(見上一篇) |
幾個要說明的限制
- 每組只生成一次,單次結果有運氣成分(Antigravity 的翻車事件就是證明)。
- 這三家都不能固定 seed,沒辦法做到嚴格的控制變因。
- 評審只有兩位:我(純主觀)和 Claude(照 prompt 程度)。你的眼光可能跟我們都不一樣——圖都放在上面了,歡迎自己選一輪。
相關文章
- Krea2 微調模型大亂鬥:官方 Turbo 對決四個社群微調,35 組同 seed 實測 — 同一套 prompt 測開源模型,可固定 seed 的嚴謹版
- Boogu Image 0.1 實測:開源文字渲染新標竿? — 圖裡要有正確中文字的話,目前開源的 Boogu 最穩
- KREA 2 實測:中文 Prompt 能用嗎?四種官方 LoRA 風格全比較




