
HiDream-O1-Image 是 HiDream 在五月開源的生圖模型,8B 參數、MIT 授權,可商用。它的官方介紹跟一般模型不太一樣:不只說「畫得好」,而是列了六項具體能力,還附了技術報告。既然官方把話說得這麼具體,這篇就不做泛用評比,改成逐條驗證:官方說了什麼,本機跑出來對不對。
題目是這次新寫的 63 組,跟我之前幾篇評測用的題庫完全不重疊。每一組的 prompt 都印在對照圖的底部,完整題目(含中文說明與 Prompt Agent 改寫版)另外整理成一篇:HiDream-O1 測試 Prompt 全公開。
快速結論
- 成立的宣稱:多張參考圖合成的身份一致性很強,人、衣服、場景分別給參考圖都能正確組合;Prompt Agent 很有用,像「王維的《鹿柴》刻在竹簡上」這種要先知道詩句內容才畫得出來的題目,先讓它改寫 prompt 再生成,結果好非常多;2560×1440 橫幅、1440×2560 直幅、3104×1312 超寬幅三種官方訓練過的尺寸都正常出圖
- 打折的宣稱:「沒有 VAE 所以細節更多」在皮膚、毛髮上成立,Full 版的細節確實比 Dev 多,但雜訊也多,手錶這類精密物件還會生出多餘的零件;繁體中文大字大多寫對,但 Full 與 Dev 的錯字率都還是高;指令編輯能換字,卻做不到「其他部分不變」
- 不成立的宣稱:15 種鏡位在同一個 seed 下大半看不出差別;一次生成四格分鏡的角色能保持一致,格內的標題與編號幾乎必亂
- Dev 蒸餾版在文字題明顯劣化,整段英文長文 Full 逐字正確、Dev 亂碼,不是官方說的「幾乎沒有損失」;Full 檔加上官方的 Dev LoRA 看起來就是 Dev,想省硬碟可以只裝 Full
先認識一下這個模型
先解釋一個名詞。目前大多數生圖模型(Stable Diffusion、Flux、Krea 都是)不是直接畫像素,而是先用一個叫 VAE 的元件把圖片壓縮成一張小很多的「草圖」,模型在草圖上作畫,畫完再由 VAE 放大還原成完整圖片。這樣做的好處是省算力,代價是壓縮與還原之間會損失細節,皮膚毛孔、布料織紋、小字的筆畫這類細小的東西最容易被抹平。
HiDream-O1-Image 拿掉了 VAE,模型直接在原始像素上作畫,文字、圖片、任務指令全部在同一個模型裡處理。官方主張這樣可以保住那些細小的東西,也讓文字的筆畫結構更穩。這篇的 A 章就是專門驗證這個說法。
官方介紹列出的能力:
- 原生 2048×2048,另有 11 種訓練解析度(最寬到 3104×1312)
- 長文字渲染與版面控制,多區域、多語言
- 指令式編輯(給一張圖,用文字說要改什麼)與多張參考圖合成(給二到十張參考圖,把裡面的人或物放進新場景)
- 單次生成多格分鏡、15 種電影鏡位控制(技術報告)
- Reasoning-Driven Prompt Agent:用一個大語言模型先推理版面、物理邏輯、隱含知識,再把你的一句話改寫成完整英文 prompt
- 兩個版本:Full(未蒸餾,官方 50 步)與 Dev(蒸餾,28 步,官方說品質幾乎無損)
技術報告的基準測試分數都很漂亮,但整份報告沒有寫任何缺點或失敗案例。這正是自己驗證的理由。
這次怎麼測
| 章節 | 驗證的宣稱 | 測法 |
| A 細節 | 沒有 VAE,高頻細節更多 | 8 題皮膚、布料、毛髮、金屬、珊瑚等質感特寫,Full、Dev 與 Krea2 Turbo(有 VAE 的一般模型,當對照組)同 seed,第二列是同一區域的放大裁切 |
| B 文字 | 長文字、多區域、多語言 | 13 題:繁體中文 8 題(故意放入「廟」「鹽」「麵」「龍」「讓」「龜」「鬱」「柵」這些筆畫複雜的字)、英文長文 3 題、中英日混排 2 題 |
| C 編輯與合成 | 指令編輯、多參考圖合成 | 參考圖全部先用 Krea2 生成(所以可以公開),編輯 5 題、二到三張參考圖合成 4 題 |
| D 分鏡與鏡位 | 單次生成分鏡、15 種鏡位 | 四格分鏡 2 題;同一個小提琴手、同一個 seed,只換鏡位描述跑 15 張 |
| E Prompt Agent | 推理改寫有沒有用 | 8 題故意寫得很短、要先知道某些知識才畫得出來的 prompt,原始 prompt 與 Agent 改寫版同 seed 對照 |
| F Dev 與 Full | 蒸餾無損、步數、長寬比 | 官方 50 步對 ComfyUI 範本的 40 步;Full 加 Dev LoRA 對 Dev 本體;三種長寬比 |
全部用 ComfyUI 原生節點與官方範本的取樣設定,Full 是 50 步、CFG 5,Dev 是 28 步、CFG 1。Prompt Agent 用官方腳本裡的系統提示詞,只把後端換成本機跑的 Qwen 27B(官方是 Gemma 31B,本機沒有)。
A. 沒有 VAE 的細節:皮膚毛髮成立,精密物件會多長東西
先看最有利於這條宣稱的題目:逆光雀斑特寫。

Full 與 Dev 的雀斑、絨毛密度都遠高於 Krea2,Krea2 的皮膚偏磨皮。這條宣稱在皮膚這類天然質感上是成立的。不過三個分支的雀斑都布滿整臉,密度超過提示詞描述的程度,這點三家都一樣。
毛髮題 Full 最自然:

換成手錶這種邊緣清楚、零件精密的東西就不同了:

Full 版的手錶多出一個錶冠、一顆寶石,錶盤上的數字是亂碼;Dev 版乾淨得多;Krea2 最乾淨但紋理最少。Full 的「細節」有一部分是模型自己補出來的東西,題材是皮膚、毛髮、布料時那是資訊,題材是手錶、金屬這類精密物件時就變成雜訊。這點決定了後面「該怎麼選」的分場景建議。
B. 文字與版面:大字大多對,錯字率仍然高
繁體中文是我每篇評測都會盯的項目。先看最好的一張:

四欄標題、三列班次、底下的「請讓座給需要的人」全部正確,錯的是「龜山」的「龜」、「臺灣」的「臺」與「灣」。兩個版本錯的字一模一樣。
超商海報乍看完成度很高,但仔細核對,兩個版本的大標題裡「鹽」「糰」都是錯字,Dev 版還冒出亂碼小字:

廟宇對聯是這次的難題。匾額「慈祐宮」與右聯「龍飛鳳舞護蒼生」都對,但左聯開頭的「鬱鬱」兩個版本都寫成錯字,Full 還把對聯多貼了一份到內側的柱子上:

八題繁體中文逐字核對下來,這幾個筆畫複雜的字裡「廟」「麵」「龍」「讓」寫對,「鹽」「糰」「龜」「灣」「鬱」「柵」寫錯。大標題乍看像樣,但逐字核對的錯字率還是高,與 SenseNova 那篇的結論相比,HiDream-O1 沒有把繁體中文的天花板再往上推。
英文長文則是 Full 與 Dev 差距最大的題目:

Full 版整段六十個字幾乎逐字正確;Dev 版亂碼,還把一張紙畫成兩張。這一題直接推翻「蒸餾版幾乎無損」的說法,至少在文字上不成立。
多區域的資訊圖 Full 版面完成度高,五個標籤四個正確,但「木柵」寫成「木桃」,還把同一個標籤畫了兩次:

跟所有模型一樣,畫面裡的背景小字(貨架商品、遠處旗幟)都是亂碼。
C. 編輯與多參考圖合成:把參考圖裡的人放進新場景是它最強的能力
指令編輯:字換得掉,其他部分不會不動
把英文招牌換成中文店名,兩個版本都成功:

但提示詞裡「其他部分保持不變」沒有做到:Full 版整張偏綠、磚牆帶噪點、光線變了;Dev 版整張褪色。換沙發加貓那題也一樣,兩個版本都改了燈光,Full 移掉抱枕、植物長大,Dev 多加了一盞吊燈:

我懷疑偏色是 ComfyUI 範本裡的接縫平滑節點造成的,所以關掉它再跑一次,另外也試了把噪聲縮放調低:

關掉接縫平滑後偏色一模一樣,噪點反而更明顯;噪聲縮放調低直接出灰圖(這個值是像素空間模型的訓練常數,不能動)。所以偏色是模型本身的行為,目前沒有旋鈕可以修。平滑背景的編輯(例如精華液瓶的標籤)幾乎不偏色,磚牆這類高頻紋理才明顯。
多參考圖合成:身份一致性很強
給兩張不同角度的角色圖,要它站到雨夜的台北夜市:

辮子、眼鏡、雨衣、雨鞋全部保留,Dev 版一樣強。再難一點,人、夾克、餐館三張參考圖分別給:

人的臉、夾克的袖章、餐館的霓虹字都正確組合,連參考圖裡的招牌文字都保留。3D 機器人正反面兩張參考圖也能放到海邊:

這是六章裡最沒有爭議的一章。帶參考圖的生成速度比純文生圖慢兩倍多,Dev 版在這一章的表現與 Full 接近,實際使用選 Dev 就夠。
D. 分鏡與鏡位:角色一致,文字必亂,鏡位大半無感
四格分鏡的角色跨格一致性不錯,燈塔老人與機器人在四格裡都是同一個角色:


但格內的標題與編號幾乎必亂:燈塔那題的編號是 2、5、5、4,標題拼錯;機器人那題 Full 版寫出「STURE」「PANEL」這種東西,Dev 版反而比較乾淨。
技術報告說支援 15 種電影鏡位。同一個小提琴手、同一個 seed、只換鏡位描述:

肉眼看不出太多差別。只有特寫系、過肩鏡頭與俯角有反應;極遠景、遠景、全身、鳥瞰、蟲視幾乎是同一個構圖,第一人稱視角完全錯(還是正面拍她),荷蘭角只微傾。這條宣稱在同 seed 的條件下不成立。
E. Prompt Agent:題目需要背景知識時,先改寫再生成
這是官方隨模型一起釋出的工具:一個大語言模型先分析你的需求、解析隱含知識、規劃版面,再輸出一段完整的英文 prompt。我用官方的系統提示詞、本機的 Qwen 27B 跑,八題都改寫成功。
最能說明差距的是「王維的《鹿柴》刻在一片竹簡上」:

原始 prompt 只刻了「鹿柴」兩個字外加一隻鹿;Agent 版把整首詩二十個字全部正確刻在竹簡上,因為 Agent 在改寫時就把詩句查出來寫進 prompt。「提出運動三定律的那個人的博物館展區」也一樣:

原始 prompt 畫出一個肌肉解剖模型,Agent 版是牛頓銅像加 F = ma。文物題更明顯:

原始 prompt 畫成粉彩鹿紋碗,完全不是汝窯;Agent 版天青釉、開片、紫口鐵足都對。
這跟我在 SenseNova 那篇測 prompt 增強的結論一致:模型本身不會補知識,改寫層才是「推理」。差別是 HiDream 把這個工具直接附在模型旁邊,而且用本機的 Qwen 27B 取代官方的 Gemma 31B 也沒有明顯短板。
F. Dev 與 Full:步數不用 50,LoRA 就是 Dev
官方說 Full 跑 50 步,ComfyUI 範本減成 40 步。同 seed 對照:

50 步與 40 步幾乎逐像素相同,範本減步是對的,時間省兩成沒有損失。同一張圖也看得到 Dev 的另一個問題:花呢的橘色與紫色纖維在 Dev 版消失了,變成素面斜紋。
官方另外提供一個 Dev LoRA,掛在 Full 上、用 Dev 的取樣設定跑。我原本以為它會是「Full 的細節、Dev 的乾淨」的折衷,結果跑完 21 題,它就是 Dev:

文字題錯的方式與 Dev 相同,細節題的構圖與質感也向 Dev 靠攏,肉眼乍看不出差別。實用結論是只裝 Full 檔加這個 440MB 的 LoRA,就同時有 Full 與 Dev,省下一份 16GB 的 Dev 檔。
三種訓練解析度的長寬比都正常,沒有拼接感:

該怎麼選
| 需求 | 建議 |
| 人像、毛髮、布料這類天然質感的特寫 | O1 Full,細節比有 VAE 的模型多;接受它同時帶來的雜訊 |
| 手錶、金屬、儀表這類邊緣清楚的精密物件 | O1 Dev 或其他模型,Full 會補出多餘的零件與亂碼 |
| 一段完整正確的英文文字 | O1 Full,這次唯一整段逐字正確的分支;Dev 不要用在文字上 |
| 繁體中文標題 | 大字大多寫對,但錯字率仍高,SenseNova 還是比較穩 |
| 多張參考圖合成人物、物件、場景 | O1 Dev,這一章 Dev 與 Full 一樣強而且快得多 |
| 需要背景知識的題目(詩詞、人物、文物、UI) | 先過 Prompt Agent 再生成,用本機大語言模型跑就可以 |
| 想省硬碟 | 只裝 Full 檔加 Dev LoRA,兩種版本都有 |
想自己跑:ComfyUI 設定
| 檔案 | 下載 | 放置位置 |
| hidream_o1_image_bf16.safetensors(Full,約 16GB;另有 fp8 版) | Hugging Face Comfy-Org | models/checkpoints/ |
| hidream_o1_image_dev_bf16.safetensors(Dev;或改用下面的 LoRA) | 同上 | models/checkpoints/ |
| hidream_o1_dev_lora_rank_64_bf16.safetensors(Dev LoRA,約 440MB) | 同上 | models/loras/ |
| gemma4_e4b_it_fp8_scaled.safetensors(文字編碼器) | Hugging Face Comfy-Org gemma-4 | models/text_encoders/ |
ComfyUI 原生支援,範本在「HiDream O1」與「HiDream O1 Dev」兩個工作流裡,包含文生圖與圖片編輯的切換開關,參考圖最多十張。幾個實測踩過的地方:
- 節點裡有一個「噪聲縮放」,Full 是 8、Dev 是 7.6。這是像素空間模型的訓練常數,不是美學旋鈕,調低會直接出灰圖
- Full 的接縫平滑節點確實有在壓噪,關掉會更糟,但它不是編輯偏色的原因
- Full 跑 40 步就夠,跟官方的 50 步幾乎相同
- 帶參考圖的編輯與合成比純文生圖慢兩倍多,這類工作用 Dev 就好
- Prompt Agent 是官方 GitHub 上的
prompt_agent.py,可以接任何 OpenAI 相容的本機端點;輸出的 JSON 裡除了改寫後的 prompt,還有它解析出的隱含知識,方便檢查
授權是 MIT,模型與生成圖都可商用。
完整對照圖
每張對照圖底部都印有該題的 prompt,可複製的文字版在 HiDream-O1 測試 Prompt 全公開。
A 細節(Full、Dev、Krea2 Turbo 與放大裁切)








B 文字(Full 與 Dev)













C 編輯與合成(參考圖、Full、Dev)









D 分鏡與鏡位



E Prompt Agent(原始 prompt 與改寫版)








F 步數與 LoRA(前五題)










相關文章
- HiDream-O1 測試 Prompt 全公開 — 本文 63 組題目的文字版,附中文說明與 Agent 改寫版
- SenseNova U1.5 繁體中文實測 — 繁體中文文字渲染目前的天花板,本文 B 章的比較基準
- SenseNova 官方 Prompt 增強實測:AI 生圖的亂碼不是隨機的 — 與本文 E 章相同的結論:改寫層才是推理
- Krea2 微調模型大亂鬥 — 本文 A 章對照組 Krea2 Turbo 的來歷
- 動漫生圖模型 8 路對決 — 同樣的同 seed 評測方法論



