
Lens 是微軟研究院在六月開源的文生圖模型,3.8B 參數、MIT 授權,可商用。它的論文標題是「重新思考文生圖模型的訓練效率」,主張很直接:圖片的文字描述寫得夠好,模型不用大。它用來訓練的 8 億張圖,每一張都由 GPT-4.1 重新寫過平均 109 個英文字的長描述,模型本身只有 3.8B,卻配了一個 20B 的語言模型當文字編碼器。
論文也把對手點名了:遵循度測試贏過 Flux.2 Klein 與 Z-Image、接近 Qwen-Image;長文字渲染贏過 Z-Image Turbo。這三個對手我電腦裡都有,所以這篇就照上一篇 HiDream-O1 的做法,官方說什麼,就在自己的電腦上用同樣的題目對照,看對不對。
另外還有一件我自己很想弄清楚的事。Lens 有一個 4 步的 Turbo 版,我上個月跑過 35 題,很多題目 Turbo 看起來比 20 步的標準版還好看。這次一起把原因找出來。
快速結論
- 測出來成立的說法:遵循度(模型有沒有照 prompt 畫)贏過 Flux.2 Klein,12 題「數量、顏色、位置」的考題 Lens 只錯 1 題,Klein 錯 3 題;長 prompt 裡的細節(檯燈顏色、腳印、杯子數量)Lens Turbo 幾乎都有畫出來
- 看不出差別的說法:論文說贏過 Z-Image,在我的電腦上看不出差距,Z-Image Turbo 也只錯 1 到 2 題
- 測出來不成立的說法:英文長文字沒有贏過 Z-Image Turbo,反而是 Z-Image 與 Qwen 2512 幾乎逐字全對;Lens 的正確率排在六家中間,而且它會把整段文字縮得很小,錯字不容易一眼看出來
- 繁體中文:官方自己也說非英文的文字比較弱,實際測起來確實如此,還會把繁體 prompt 畫成簡體字
- Turbo 為什麼比標準版好看:不是參數的問題。標準版從 CFG 2 試到 5、步數加到 40,畫面幾乎一樣;Turbo 是另外蒸餾出來的模型,本來就長得不同。日常使用選 Turbo 就好
先認識一下這個模型
先解釋兩個名詞。
文字編碼器:生圖模型看不懂英文,需要一個「翻譯官」先把你的 prompt 轉成模型看得懂的數字。大部分模型用的翻譯官是 CLIP 或 T5 這類專門訓練來理解圖文的小模型;Lens 直接用 OpenAI 開源的 GPT-OSS 20B 語言模型當翻譯官,而且不是只拿最後一層的輸出,是把第 4、12、18、24 層的理解結果拼在一起送給畫圖的部分。官方說這是它遵循度好、也能看懂中文 prompt 的原因。這個翻譯官比畫圖的模型本身大五倍,所以雖然模型只有 3.8B,硬碟還是要準備 20GB 以上。
長描述訓練:訓練生圖模型需要「圖片加上描述」成對的資料。一般資料集的描述很短,例如「一隻狗在草地上」;Lens 把 8 億張圖全部用 GPT-4.1 重寫成平均 109 個字的長描述,把衣服材質、光線方向、鏡頭都寫進去。論文主張這樣每一張圖能教給模型的東西多很多,所以用 Z-Image 不到兩成的算力就能訓練到同等水準。
它有三個版本:
- Lens-Base:50 步的基礎版
- Lens:Base 再經過強化學習調整,官方預設 20 步、CFG 5,這篇說的「標準版」就是它
- Lens-Turbo:蒸餾成 4 步、不用 CFG 的快速版
三個版本共用同一個文字編碼器與 Flux.2 的 VAE,原生解析度最高 1440×1440,長寬比從 1:2 到 2:1。
官方也寫了限制:主要用英文資料訓練,非英文的文字渲染會比較弱;罕見的物件組合與複雜版面可能做不好。這篇會一項一項測試對照。
還要先解釋一個會反覆出現的詞:GenEval。它是學術界常用來考生圖模型的一張考卷,題目都是「兩顆紅球在藍色方塊左邊」這類短句,由程式自動檢查畫出來的數量、顏色、位置對不對,滿分 1。論文說 Lens 得 0.93、Klein 0.85、Z-Image 0.84,這篇的 C 章就是照這種題型自己出題。
這次怎麼測
| 章節 | 要回答的問題 | 測法 |
| A Turbo 與標準版 | 4 步的 Turbo 為什麼常比 20 步標準版好看 | 上個月跑過的 35 題,標準版同一個 seed 再跑 CFG 2、CFG 3.5、以及 40 步,跟原本的 CFG 5 與 Turbo 排在一起看 |
| B 短句與長句 | 用長描述訓練的模型,給短 prompt 會不會反而畫不好 | 8 個場景各寫一句 10 個字的短版與一段 110 字的長版,Lens Turbo、Mage-Flow Turbo、Krea2 Turbo 同 seed 對照 |
| C 遵循度 | 論文說贏 Klein 與 Z-Image | 12 題數量、顏色、位置、兩個物件、罕見組合的考題,Lens、Lens Turbo、Flux.2 Klein 9B、Z-Image Turbo、Qwen 2512、Mage-Flow Turbo 六家同題 |
| D 英文長文字 | 論文說贏 Z-Image Turbo | 6 題每題含一段 30 到 60 字的英文,必須逐字出現,同樣六家 |
| 繁體中文 | 官方自己也說比較弱,實際弱到什麼程度 | 我固定用的 53 題繁體中文題庫全跑 |
每一家都用 ComfyUI 官方範本的取樣設定與各自的原生解析度,Lens 是 1440×1440,其他是 1024×1024。Mage-Flow 也是微軟出的小模型,跟 Lens 剛好是同門、不同路線(它用 Qwen3-VL 4B 當文字編碼器),所以放進 B 章當對照。
C 章的六家對照可以順便看出各模型的風格差異,不過這篇只看遵循度,不評美感。
A. Turbo 為什麼比標準版好看:不是 CFG,也不是步數
先說 CFG 是什麼。CFG 是生圖時「要多聽 prompt 的話」的旋鈕,數值越高,畫面越會照著 prompt 的描述走,對比也越強;太高就會出現顏色過飽和、邊緣過硬的 AI 感。官方範本標準版是 CFG 5,我原本懷疑這個值偏高,才讓標準版看起來不如 Turbo。
所以同一個 seed,標準版跑了 CFG 2、CFG 3.5、CFG 5,再加一組 40 步的 CFG 5,跟 Turbo 排在一起:

結果出乎意料。標準版的四張圖構圖幾乎一模一樣,CFG 只改變對比與飽和度,40 步跟 20 步肉眼看不出差別。Turbo 那張則是完全不同的構圖,人物站位、衣服、光線都不一樣。

再看細節。這一題標準版的打字機鍵盤、紙張上的字都比 Turbo 多,Turbo 的小貓比較像一張乾淨的照片。哪一張比較好看,其實每一題答案不同:

肖像這題 Turbo 的皮膚自然,標準版 CFG 5 那張臉部的皮膚看起來比較生硬、不自然。但打槌球那題標準版的服裝細節與場景層次反而比 Turbo 豐富。我試著找一個「最好的 CFG」,找不到,有的題目 CFG 高 AI 感太重,有的題目 CFG 高反而好看,CFG 高也比較容易出現比例或結構上的錯誤。
結論是這不是參數可以調出來的差別。Turbo 是從標準版蒸餾出來的另一個模型,蒸餾過程本身改變了它的畫風,偏向乾淨、照片感;標準版保留較多細節,但也帶著較多的雜訊與硬邊。官方範本的 CFG 5 是合理的預設值,不用改。想要哪一種畫風,換模型比調參數有效。
日常使用我會選 Turbo,4 步比 20 步快很多,大部分題目也比較耐看。需要細節密度的題目(機械、織物、大量小物件)再換標準版。
B. 短句與長句:長描述訓練的模型不怕短 prompt
論文的核心主張是長描述訓練有效,我想反過來問:一個只看過長描述的模型,給它 10 個字會不會不知道怎麼畫。
8 個場景各寫兩版。短版像一般人隨手打的:「一個女人在有陽光的咖啡館看書」;長版照 GPT-4.1 寫描述的口吻,把年齡、衣服材質、桌上的東西、光線、鏡頭焦段全部寫進去,大約 110 個字。三家同 seed:

短版三家都畫得很正常,Lens Turbo 沒有因為 prompt 短就崩掉。長版才看得出差別:prompt 裡寫的綠色玻璃燈罩的檯燈、有奶泡痕跡的卡布奇諾、捲到手肘的亞麻襯衫,Lens Turbo 與 Mage-Flow 都畫出來了,Krea2 漏了檯燈。

狐狸這題長版寫了「一排腳印朝鏡頭延伸」,Lens Turbo 與 Mage-Flow 有腳印,Krea2 沒有而且狐狸縮得很小。
八組看下來,短 prompt 三家差不多,長 prompt 的細節遵循 Lens Turbo 與 Mage-Flow 最完整。我原本的擔心沒有發生,長描述訓練沒有讓它變成只會畫長句的模型。
有一個小地方值得提。短版的「兒童房裡都是玩具」,Lens Turbo 自己加了兩個小孩進去,其他兩家都只畫房間:

它會自行補充 prompt 沒寫的內容,這在 prompt 短的時候是好是壞,看你的需求。
C. 遵循度:贏過 Klein 是真的,贏過 Z-Image 看不出差別
論文用的遵循度測試就是前面說的 GenEval,考的是很基本的事:數量對不對、顏色有沒有畫在對的東西上、左右上下的位置對不對、兩個不相干的東西能不能同時出現。我照這個方向自己寫了 12 題,不用論文的原題,六家同 seed。
先看數量題,「剛好五顆氣球:兩紅、兩黃、一綠」:

Lens 兩個版本、Z-Image、Mage-Flow 都是五顆,顏色也對;Klein 只畫了四顆,Qwen 畫成一串六顆以上。
顏色綁定最難的一題是「綠蘋果放在紫色盤子上,粉紅色香蕉放在盤子旁邊」:

顏色六家都對,但「香蕉在盤子旁邊」只有 Qwen 做到,其他五家都把香蕉放到盤子上。這是 Lens 唯一明確畫錯的一題。
複合條件題「兩隻黑貓坐在黃色車頂上,一隻橘貓站在車子右邊的地上」:

Lens 兩個版本、Klein、Z-Image、Qwen 都對,Mage-Flow 只畫了一隻黑貓。「四張木椅一排,只有左邊數來第二張漆成藍色」:

Lens、Z-Image、Qwen 對;Klein 把第三張也漆成白色,Mage-Flow 漆了兩張藍的。
12 題我逐張核對,畫對的題數:
| 模型 | 12 題畫對 | 錯在哪 |
| Lens | 11 | 香蕉放到盤子上 |
| Lens Turbo | 11 | 同上 |
| Z-Image Turbo | 10 到 11 | 香蕉;書本數量疑似多一本 |
| Qwen 2512 | 10 | 氣球超過五顆;書本數量 |
| Flux.2 Klein 9B | 9 | 氣球只有四顆;椅子多漆一張;蝸牛的圍巾不明顯 |
| Mage-Flow Turbo | 9 | 黑貓只有一隻;椅子漆兩張;蝸牛的圍巾不明顯 |
有四題(三個杯子、紙飛機在魚缸上方、長頸鹿與紅綠燈、烤麵包機與小提琴)六家全對,難度太低,下次可以拿掉。
論文說 Lens 的遵循度贏過 Klein,在我的電腦上測出來也是這樣;說贏過 Z-Image,這 12 題看不出差距;跟 Qwen 則互有勝負。Lens 與 Lens Turbo 的遵循度一樣好,所以選 Turbo 不會犧牲這一項。
D. 英文長文字:沒有贏 Z-Image,而且它會把字縮小
每題有一段必須逐字出現的英文,例如黑板上的今日特餐:

Z-Image Turbo 與 Qwen 2512 整段正確;Lens 標準版大致對,但「kinetic」「sculpture」這類字會拼錯;Lens Turbo 比標準版差,「fresh」寫成「frow fresh」;Klein 與 Mage-Flow 錯得最多。
引言卡是最能看出差異的一題,只有兩句話、一個人名:

Z-Image 與 Qwen 逐字正確而且字排得大方;Lens 標準版把整段字縮得很小、擠在卡片中央,放大看還是有錯字;Lens Turbo 中間那幾行直接變成亂碼。
活動海報也一樣,標題「NIGHT OF SMALL MACHINES」Lens Turbo 寫成「SMAL」,Mage-Flow 寫成「SMAALL」:

六題看下來排名很清楚:Z-Image Turbo 與 Qwen 2512 最準,Lens 標準版排在中間,Lens Turbo 再差一級,Klein 與 Mage-Flow 最後。論文說 Lens 的長文字渲染贏過 Z-Image Turbo,我測出來的結果相反。
還有一個值得注意的習慣:Lens 遇到長段文字時傾向把字縮小、留很多白邊(書頁、展板、引言卡三題都是)。字小了錯字就不明顯,乍看完成度很高,放大才發現問題。核對文字的時候要記得放大看。
繁體中文:不行,還會漏簡體
官方自己也說非英文的文字渲染比較弱,53 題跑完確實如此,大字小字都不對,這裡只放一張代表:

「漫旅」寫成「湯旅」,副標題「一場永不結束的散步」被畫成簡體字「一场永不结束的散步」,而 prompt 明明寫的是繁體。這個現象在其他題目也出現,例如「週年慶」寫成「周年慶」。我的猜測是文字編碼器 GPT-OSS 看過的中文資料以簡體為主,模型把繁體 prompt 理解成簡體去畫。需要繁體中文的話,SenseNova U1.5 還是目前最穩的選擇。
該怎麼選
| 需求 | 建議 |
| 日常快速出圖 | Lens Turbo,4 步,遵循度與標準版一樣好,畫風乾淨 |
| 細節密度高的題目(機械、織物、大量小物件) | Lens 標準版,保留較多細節,接受它同時帶來的雜訊;CFG 維持官方的 5 |
| 長 prompt、要求很多細節都要出現 | Lens Turbo 或 Mage-Flow Turbo,兩家都比 Krea2 完整 |
| 數量、顏色、位置要精確 | Lens 或 Z-Image Turbo,兩家在這次的考題表現接近 |
| 一段完整正確的英文文字 | Z-Image Turbo 或 Qwen 2512,不要選 Lens |
| 繁體中文 | 不要用 Lens |
| VRAM 有限的電腦 | 文字編碼器就要 13GB,Lens 不是省資源的選擇;同樣是微軟出的 Mage-Flow Turbo 輕得多 |
想自己跑:ComfyUI 設定
| 檔案 | 下載 | 放置位置 |
| lens_turbo_bf16.safetensors(Turbo,約 8GB;另有 mxfp8 版) | Hugging Face Comfy-Org/Lens | models/diffusion_models/ |
| lens_bf16.safetensors(標準版,約 8GB;另有 mxfp8 版) | 同上 | models/diffusion_models/ |
| gpt_oss_20b_nvfp4.safetensors(文字編碼器,約 13GB) | 同上 | models/text_encoders/ |
| flux2-vae.safetensors(VAE,約 300MB;已有 Flux.2 的人不用重抓) | 同上 | models/vae/ |
ComfyUI 原生支援,範本在「Lens」與「Lens Turbo」兩個工作流裡。幾個實測的備註:
- 官方設定標準版 20 步、CFG 5,Turbo 4 步、CFG 1。標準版的 CFG 不用調,調了畫面也差不多;步數加到 40 沒有差別
- 範本裡有一個 CFGNorm 節點與 ModelSamplingFlux 節點(max_shift 1.15、base_shift 0.5),照範本接就好
- 原生解析度 1440×1440,比一般的 1024 大,生成時間也相對長;Turbo 4 步是最實用的組合
- 文字編碼器很大,載入時間比模型本身久,第一張圖等比較久是正常的
授權是 MIT,模型與生成圖都可商用。微軟的原始模型頁需要登入 Hugging Face 同意條款才看得到,Comfy-Org 的轉檔版直接可下載。
完整對照圖
每張對照圖底部都印有該題的 prompt。
A Turbo 與標準版(Turbo、CFG 5、CFG 2、CFG 3.5、40 步)










B 短句與長句(Lens Turbo、Mage-Flow Turbo、Krea2 Turbo)








C 遵循度(Lens、Lens Turbo、Klein 9B、Z-Image Turbo、Qwen 2512、Mage-Flow Turbo)












D 英文長文字(同上六家)






相關文章
- HiDream-O1 實測:官方說的六件事,本機驗證對了幾件 — 同樣的「逐條驗證官方宣稱」做法
- 微軟 Mage-Flow 實測:4B 小模型四變體同場對決 — 本文 B 章對照組、微軟另一個小模型的來歷
- SenseNova U1.5 繁體中文實測 — 繁體中文目前最穩的選擇
- 繁體中文 AI 生圖測試 Prompt:53 組全公開 — 本文繁體中文章節用的題庫
- Krea2 微調模型大亂鬥 — 本文 A 章 35 題題庫與 Krea2 Turbo 的來歷



