為什麼要做這篇
上一篇把去背模型全部排在一起比過之後,下一個最常用、選項也最亂的功能就是「放大」。我這台機器的 upscale_models 資料夾裡躺著 19 款 ESRGAN 系的放大模型,很多是這幾年零零星星載下來的:UltraSharp、ClearReality、Nomos8k、FFHQDAT、FaceUpDAT、Real-ESRGAN 全家、AnimeSharp……名字一個比一個厲害,但我從來沒有把它們放在同一張圖上比過,每次要放大都憑印象挑一款。
臉部修復又是另一堆:GFPGAN、CodeFormer、GPEN 三家各有兩三個版本,Impact Pack 的 FaceDetailer 用擴散模型重畫臉,最近又多了 SeedVR2、FlashVSR 這種「用影片模型來放大」的新路線。網路上的比較文大多是 2024 年的三方對比(GPEN/GFPGAN/CodeFormer),或是 2026 年英文圈的 SeedVR2 對 SUPIR 對 FlashVSR,沒有人把「傳統放大模型+臉部修復+生成式重繪」放在同一張圖上比,繁中更是零篇。
這篇還有一個上一篇沒有的東西:標準答案。去背的好壞只能用眼睛看,但放大不一樣——我可以先生成一張高清原圖,把它故意弄糊、縮小、壓壞,再交給每一款模型放大回來,這樣每個結果都能跟原圖對照,除了看圖,還能算出「像不像原人」的分數。這點對臉部修復特別重要,因為修臉模型最大的爭議就是:它修出來的那張臉,還是不是原來那個人。
所以這篇的做法是:把所有放大與臉部修復模型接進同一張工作流,46 張測試輸入一次跑完 37 條路線,每條結果都放回原圖大小存檔,排在一起比,再對原圖算分。
快速結論
- 糊掉的、小的、壓縮過的照片,日常主力選 SeedVR2 3B:128/256 像素輸入、仿老照片、小臉群像,它在所有題目都排第一,而且是最像原人的一款——這是這次最重要的結論。傳統 ESRGAN 系模型碰到真正糊的圖會把小臉放大成面具,SeedVR2 會把臉重建回來
- 本來就清晰的圖只是要變大,傳統 ESRGAN 系反而更忠實也更快:4xNomos8kSCHAT-L、2xNomosUni SPAN、4xFFHQDAT 在輕微降質的輸入上分數比 SeedVR2 好
- GFPGAN/CodeFormer/GPEN 會把臉修乾淨,代價是身份相似度下降:三家都比「只放大不修臉」更不像本人,CodeFormer 把 fidelity 拉到 1.0 最保守。它們適合「想看起來好看」,不適合「想還原這個人」
- FaceDetailer 與 Ultimate SD Upscale 是換臉,不是修臉:身份相似度全場最低,老照片上直接變成另一個人;只適合自己生成的 AI 圖想補細節的場合
- 老照片交給 SeedVR2 3B,想順便修臉接 CodeFormer(fidelity 1.0);GPEN 與 GFPGAN 會給黑白照上色,FaceDetailer 會換臉,都不要用
- 真正需要留的模型不多:SeedVR2 3B、一款通用 4x(4x-UltraSharp 或 4xNomos8kSCHAT-L)、一款快速 2x(2xNomosUni SPAN)、動漫用 Real-ESRGAN anime 6B、修臉用 CodeFormer,就能覆蓋幾乎所有情境
先懂三件事:放大、修復、重繪
放大(upscale) 是把一張小圖變大。最簡單的做法是插值——電腦在相鄰像素之間算出中間值填進去,結果就是放大後那種糊糊的樣子;這次的「純插值放大」就是這種,當基準用。AI 放大模型(ESRGAN 系)多了一件事:它看過大量「清晰圖與對應的糊圖」,學會從糊的樣子猜出原本應該有的邊緣和紋理,所以放大後會變銳利。但它只能「銳化既有的線索」,線索本身不夠的時候,它會把錯的東西銳化得很有自信——這次小臉群像的面具臉就是這樣來的。
臉部修復(face restoration) 做的事情不一樣:GFPGAN、CodeFormer、GPEN 這類模型在腦子裡存了「一張正常的人臉長什麼樣」的知識,碰到糊臉時不是在銳化,而是把一張合理的臉「套」上去。所以它們的結果幾乎永遠很乾淨、很好看,問題是那張臉有多少成分是原來那個人的,有多少是它腦子裡那張「正常臉」的。這就是「修臉會換臉」的原因,也是我這次一定要算身份相似度的原因。
生成式重繪(generative redraw) 更進一步:FaceDetailer 和 Ultimate SD Upscale 是把圖丟回文生圖模型(這次用 Krea2 Turbo 與 SDXL),讓它以原圖為底重新畫一遍。重繪強度低的時候像是在補細節,強度高就是新畫一張。它能補出最多的紋理(毛孔、雀斑、皺紋),但跟原圖的關係最鬆。
SeedVR2 與 FlashVSR 則是第四種:它們是為影片放大設計的擴散模型,單張圖也能用。它們像生成式重繪一樣有「世界知識」,能把糊掉的小臉重建回來,但訓練目標是「忠實放大」而不是「重新創作」,所以這次它們同時拿到最好的畫質分數和最高的身份相似度——兩邊的優點都佔到。
模型演進小史
- 2018 ESRGAN:第一代用對抗訓練的放大模型,開啟了社群自己訓練放大模型的風氣。原版在這次是倒數,但它的架構被後來幾百款模型沿用
- 2021 Real-ESRGAN:騰訊 ARC 實驗室的改良版,訓練時把圖故意加上真實世界會有的模糊、壓縮、雜訊再學著還原,所以對「真的壞掉的照片」比原版穩很多;x4plus 與動漫專用的 anime 6B 到現在還是很多人的預設
- 2021 GFPGAN:同一個實驗室的臉部修復模型,借 StyleGAN 的人臉知識把糊臉修好。v1.4 是最後一版
- 2021 GPEN:阿里的臉部修復,概念類似,後來出了 512/1024/2048 三種輸出解析度
- 2022 CodeFormer:新加坡南洋理工的作法,多了一個 fidelity 參數讓你在「修得漂亮」和「像本人」之間自己調——這次實測這個參數確實有用
- 2022–2024 社群自訓 ESRGAN 模型:UltraSharp、Nomos8k、ClearReality、FFHQDAT、FaceUpDAT 等等,在 OpenModelDB 上有幾百款,各自針對不同素材訓練
- 2024 SUPIR:用 SDXL 做高保真放大,畫質很好但吃資源,這次沒有安裝所以沒測
- 2025 SeedVR2:字節跳動的影片放大擴散模型,一步取樣,有 3B 與 7B 兩個尺寸
- 2025 FlashVSR:專門追求速度的影片放大模型,這次用 1.1 版的完整模式測單張圖
測試方法
測試圖與標準答案。 我先用 Krea2 Turbo 生成 12 張高清原圖,涵蓋正臉、側臉、戴眼鏡、老人皺紋、雙人、八人小臉群像、動漫臉、貓毛、文字招牌、建築細節、風景、花與書頁文字。然後用程式把每張原圖降質成三個等級:長邊 512 像素加輕微 JPEG 壓縮(像老手機照片)、256 像素加模糊與較重壓縮(像論壇縮圖)、128 像素加模糊、雜訊與重壓縮(像小頭像或低解析掃描)。七張有臉的圖另外做一版「仿老照片」:縮到 320 像素、泛黃褪色、加顆粒、降對比。這樣每個結果都有原圖可以對照。
真老照片。 程式做的仿舊畢竟不是真的,所以另外從 Wikimedia Commons 抓了三張公有領域的老照片(1936 年的《移民母親》、1863 年的林肯肖像、1927 年的索爾維會議合照),縮到 400 像素當輸入。這三張沒有標準答案,只看圖。
37 條路線。 分五組:純插值放大 1 條當基準;ESRGAN 系 18 條(含兩條先過 1x 前處理模型再放大);擴散式放大 5 條(SeedVR2 3B 兩個版本、7B 兩個版本、FlashVSR);放大後修臉 10 條(4x-UltraSharp 放大後分別接 GFPGAN 1.3/1.4、CodeFormer fidelity 0.5/1.0、GPEN 512/1024/2048,另外兩條測「先修臉再放大」的順序,一條測 SeedVR2 之後再接 CodeFormer);生成式重繪 3 條(FaceDetailer 配 Krea2 Turbo、Ultimate SD Upscale 配 Krea2 與 SDXL)。每條最後都放回原圖大小(1024 像素)存檔,拼接圖上的局部放大是 1:1 像素。
分數。 每張結果對原圖算四個數:PSNR、SSIM(兩個傳統的像素相似度)、LPIPS(用神經網路算的感知距離,比前兩個更接近人眼,越低越像)、還有 FaceID——用 ArcFace 人臉辨識模型算原圖的臉與結果的臉的餘弦相似度,越高越是同一個人。文章裡主要看 LPIPS 和 FaceID,因為 PSNR 有個陷阱:純插值的糊圖 PSNR 反而最高,糊本身就是一種「平均」,分數好看但人眼一看就知道不對。
兩個誠實揭露。 第一,SeedVR2 7B 的 fp16 版在我的環境跑完取樣、要釋放模型時會讓整個 ComfyUI 崩潰,試了三次都一樣,所以 7B 這次用 fp8 版代表,文中的「7B」都是指 fp8 版。第二,標準答案是 AI 生成的圖,不是真實照片;AI 圖本身的紋理分布跟相機照片不完全一樣,所以分數的絕對值不要過度解讀,看排名就好。三張真老照片放在那裡就是為了補這個缺口。
小臉群像:傳統放大的面具臉,SeedVR2 的重建
先看最能說明問題的一題。八人合照縮到 256 像素,每張臉只剩十幾個像素高。

ESRGAN 系全部失敗,而且是同一種失敗法:每張臉都被銳化成一個「面具」——眼睛、嘴巴的位置對了,但五官像是用麥克筆描出來的。4x-UltraSharp、Real-ESRGAN x4plus、連訓練在人臉上的 4xFaceUpLDAT 都一樣。這不是模型不好,是這類模型的原理決定的:它只能銳化輸入裡有的線索,十幾個像素的臉根本沒有線索可銳化。
SeedVR2 把每張臉都重建回來了,3B 與 7B 都是,而且重建出來的臉跟原圖對得上。看整張圖更明顯:

這題 SeedVR2 3B 的 LPIPS 是 0.110,4x-UltraSharp 是 0.27,純插值 0.49。
嚴重低解析的正臉:誰能把 128 像素的臉救回來
正臉縮到 128 像素,加模糊、雜訊與重壓縮,大概是網路上最糟的那種大頭貼。

ESRGAN 系全數糊掉,4xFaceUpLDAT 算是裡面最好的,能看到一點皮膚質感,但跟原圖還差很遠。SeedVR2 3B 與 FlashVSR 都把臉救回來了,膚質、鼻翼、嘴唇的形狀跟原圖對得上。CodeFormer 修出來的臉乾淨漂亮,但仔細對原圖會發現眼型和嘴型都「標準化」了一點。FaceDetailer 補出最多的毛孔與雀斑,可是原圖根本沒有雀斑——這就是生成式重繪的本質,它在畫它覺得合理的臉。
128 像素等級的 FaceID(身份相似度,有臉的幾張圖平均):SeedVR2 3B 0.60、FlashVSR 0.55、4x-UltraSharp 0.37、CodeFormer 0.34、FaceDetailer 0.33。在這種輸入下,所有修臉路線的相似度都不如 SeedVR2 直接放大。(這張正臉特寫因為臉佔滿整個畫面,人臉辨識模型在原圖上抓不到臉,所以它本身沒有 FaceID,數字來自同等級其他有臉的圖。)
本來就清晰的圖:傳統模型反而贏
換一個方向:輸入只有輕微降質(512 像素、輕微 JPEG),這是「AI 生圖想放大」或「相機照片要放大輸出」的常見情境。

這裡排名翻過來了。LPIPS 最好的前五名全是 ESRGAN 系:4xFFHQDAT 0.080、2xNomosUni SPAN 0.089、Real-ESRGAN x2plus 0.089、4xFaceUpDAT 0.101、4xNomos8kSCHAT-L 0.101,SeedVR2 3B 是 0.107。差距不大,但方向很清楚:輸入本身乾淨的時候,不需要「重建」,只需要「銳化」,這正是傳統模型的專長,而且它們快非常多。SeedVR2 在這種輸入上會微幅改寫紋理,分數反而被拉下來。
所以日常流程可以這樣分:圖本來就清楚、只是要變大,用 Nomos8k 或 NomosUni SPAN;圖糊了、小了、壓壞了,用 SeedVR2。
三家修臉模型:GFPGAN、CodeFormer、GPEN 怎麼選
戴眼鏡的男人縮到 256 像素,眼鏡是修臉模型的經典難題。

三家在這張圖上都把眼鏡處理得不錯,差別在細節:GFPGAN 1.3 的眼型有點變、嘴唇偏紅,1.4 自然得多;CodeFormer fidelity 0.5 的皮膚最平滑,1.0 保留較多原本的紋理;GPEN 2048 的五官最銳利,但也最有「證件照」的感覺。
看 20 張有臉的測試(三個降質等級加仿老照片)合併的 FaceID:GFPGAN 1.4 是 0.585、CodeFormer 0.5 是 0.571、CodeFormer 1.0 是 0.603、GPEN 512/1024/2048 是 0.589/0.583/0.572,GFPGAN 1.3 只有 0.521。對照組:只用 4x-UltraSharp 放大不修臉是 0.608,SeedVR2 3B 是 0.739。也就是說,三家修臉模型都讓臉變得「不那麼像本人」一點,CodeFormer 的 fidelity 參數確實按它宣稱的在運作(1.0 比 0.5 更像本人),GFPGAN 1.3 可以直接刪了。
另外測了「先修臉再放大」與「先放大再修臉」兩種順序。結果是先放大再修比較穩定;先修後放的版本(尤其 GPEN 2048 先修)會出現上妝般的塑膠感,因為修臉模型在小圖上套出來的臉再被放大一次。
修臉會變年輕:皺紋是第一個被修掉的東西
老婦人縮到 256 像素。

SeedVR2 3B 把皺紋、老人斑、膚質都還原回來,跟原圖對得上。三家修臉模型都把她修年輕了——皺紋變淺、皮膚變平,這是它們「正常臉」知識的副作用。GPEN 2048 先修後放的版本最明顯。FaceDetailer 則走向另一個極端:皺紋被畫得比原圖更深更多,紋理誇張到像是另一張臉。
如果你的目的是「把阿嬤的照片修回來」,這題告訴你該選誰;如果目的是「把這張臉修得更好看」,那修臉模型反而正中需求。沒有對錯,只是要知道自己在做哪一件事。
真老照片:換臉與上色
1936 年的《移民母親》縮到 400 像素當輸入。這張沒有標準答案,但每個人都知道她長什麼樣。

SeedVR2 3B 與 FlashVSR 都保留了顆粒與年代感,五官的張力也在。GFPGAN 1.4 和 CodeFormer 1.0 修得乾淨,但臉變得太平、太新。GPEN 2048 做了一件誰都沒料到的事:它給黑白照片上了膚色——整張臉變成淡橘色,這是它訓練資料裡人臉都是彩色的後果。FaceDetailer 和 Ultimate SD Upscale 則直接換了一張臉,表情和骨架都不是她了。
林肯肖像與索爾維會議合照的結果在文末完整對照圖裡,結論一樣:老照片請用 SeedVR2 3B,想修臉接 CodeFormer fidelity 1.0,GPEN/GFPGAN/FaceDetailer 都不要碰黑白照。
文字招牌:7B 的強項
麵包店招牌縮到 128 像素,文字是最容易看出「有沒有重建對」的題目。

SeedVR2 7B 把 FRESH BREAD 的每個字母都重建得乾淨,3B 的字母也對,但招牌木紋上出現了波浪狀的條紋——3B 在規則紋理上偶爾會有這種假紋理。Real-ESRGAN x4plus 對邊緣清楚的文字意外地好,字母邊緣銳利,速度又快。4x-UltraSharp 的字是糊的。Ultimate SD Upscale(Krea2)把店裡的櫃子和麵包都重畫了一遍,文字也變了形。
文字招牌、建築直線這類邊緣清楚的畫面,是 7B 唯一明顯贏過 3B 的地方;其他題目 3B 的分數都更好或持平。
動漫:專用模型與 SeedVR2 並列

Real-ESRGAN anime 6B 與 4x-AnimeSharp 這兩款動漫專用模型在這裡表現很好,線條乾淨、色塊平整;4x-UltraSharp 這種照片向的模型會把線條弄糊。SeedVR2 3B 的 LPIPS 是全場最低(0.068),線條與色塊都還原得很準。FaceDetailer 改了眼睛的畫法,動漫圖的「畫風」被重繪成另一種。
毛髮:細節與忠實的平衡

256 像素的貓臉,鬍鬚與毛流是難點。SeedVR2 3B 與 7B sharp 把毛流重建得最完整,FlashVSR 次之,Real-ESRGAN x2plus 與 4xNomos8kSCHAT-L 在 ESRGAN 系裡最好,4x-UltraSharp 偏糊。7B sharp 版的毛髮確實比一般版更銳利一點,但整體分數沒有比較好。
數字怎麼說
完整的分數表太長(37 條路線乘四個等級),這裡放每個降質等級 LPIPS 最好的前六名,與 20 張有臉圖合併的 FaceID 排名前段。
LPIPS(越低越像原圖)
| 輸入等級 | 第 1 | 第 2 | 第 3 | 第 4 | 第 5 | 第 6 |
|---|---|---|---|---|---|---|
| 512px 輕微 | 4xFFHQDAT 0.080 | 2xNomosUni 0.089 | Real-ESRGAN x2plus 0.089 | 4xFaceUpDAT 0.101 | Nomos8kSCHAT-L 0.101 | SeedVR2 3B 0.107 |
| 256px 中度 | SeedVR2 3B 0.166 | SeedVR2 7B 0.180 | SeedVR2 7B sharp 0.186 | SeedVR2 3B(非 ema)0.191 | SeedVR2 3B→CodeFormer 0.191 | FlashVSR 0.195 |
| 128px 嚴重 | FlashVSR 0.311 | SeedVR2 3B 0.316 | SeedVR2 7B sharp 0.320 | SeedVR2 7B 0.330 | Real-ESRGAN x2plus 0.357 | SeedVR2 3B→CodeFormer 0.365 |
| 仿老照片 | SeedVR2 3B 0.292 | SeedVR2 7B 0.297 | SeedVR2 3B→CodeFormer 0.300 | SeedVR2 3B(非 ema)0.301 | FlashVSR 0.301 | SeedVR2 7B sharp 0.302 |
FaceID(越高越像本人,20 張有臉圖合併)
| 路線 | FaceID |
|---|---|
| SeedVR2 3B | 0.739 |
| SeedVR2 7B | 0.712 |
| 純插值放大 | 0.712 |
| SeedVR2 7B sharp | 0.704 |
| FlashVSR | 0.704 |
| 2xNomosUni SPAN | 0.676 |
| 4xFaceUpDAT | 0.668 |
| 4x-UltraSharp | 0.608 |
| UltraSharp → CodeFormer 1.0 | 0.603 |
| UltraSharp → GPEN 512 | 0.589 |
| UltraSharp → GFPGAN 1.4 | 0.585 |
| UltraSharp → CodeFormer 0.5 | 0.571 |
| UltraSharp → GFPGAN 1.3 | 0.521 |
| Ultimate SD Upscale(SDXL) | 0.468 |
| UltraSharp → FaceDetailer(Krea2) | 0.446 |
| Ultimate SD Upscale(Krea2) | 0.408 |
兩件值得注意的事。第一,純插值放大的 FaceID 很高(0.712),因為糊掉的臉對人臉辨識模型來說「還是那張臉」,它只是糊;這再次說明 FaceID 要跟 LPIPS 一起看,單看一個會被騙。第二,SeedVR2 的 3B「ema」版在每個等級都比非 ema 版好,兩個都裝的話留 ema 那個就好。
建議留下的模型
測完之後,我的 upscale_models 從 19 款整理成下面這幾款,已經足夠覆蓋日常所有情境:
- SeedVR2 3B(ema):糊圖、小臉、老照片的主力;7B fp8 兩版留給文字招牌與建築直線
- 4x-UltraSharp:通用 4x,也是接修臉模型前的標準放大
- 4xNomos8kSCHAT-L 與 2xNomosUni SPAN:本來就清晰的圖要變大時用,後者特別快
- 4xFFHQDAT、4xFaceUpDAT、4xFaceUpLDAT:人臉向的傳統放大,輕微降質的人像上分數最好
- Real-ESRGAN x4plus / x2plus / anime 6B、4x-AnimeSharp:x4plus 對文字邊緣穩、x2plus 在中度降質的 ESRGAN 系裡最好、後兩款給動漫
- 4x-ClearRealityV1:通用備用
- 修臉:CodeFormer(可調保真)、GFPGAN 1.4、GPEN 512/1024/2048;GFPGAN 1.3 不用留
- FlashVSR:影片向,單張圖的表現接近 SeedVR2 3B,要放大影片時的選擇
至於其他幾款——同一個檔案換名字的重複品、2018 年的原版 ESRGAN、接在前面反而弄壞圖的 1x 前處理模型——在文末完整對照圖裡都看得到它們的表現,讀者可以自己判斷。
情境推薦
| 情境 | 建議 | 為什麼 |
|---|---|---|
| 糊的、小的、壓壞的照片 | SeedVR2 3B | 所有降質等級第一,最像原人 |
| 本來清晰、只是要變大 | 4xNomos8kSCHAT-L / 2xNomosUni SPAN | 輕微降質輸入上比 SeedVR2 更忠實、快很多 |
| 糊臉想修乾淨好看 | 4x-UltraSharp → CodeFormer(fidelity 0.7) | 三家裡可調保真;想更像本人調 1.0 |
| 糊臉想還原本人 | SeedVR2 3B(不接修臉) | 修臉模型都會降身份相似度 |
| 小臉群像 | SeedVR2 3B | ESRGAN 系全部面具臉 |
| 老照片(黑白/泛黃) | SeedVR2 3B,想修臉接 CodeFormer 1.0 | GPEN/GFPGAN 會上色,FaceDetailer 會換臉 |
| 文字招牌、截圖、建築直線 | SeedVR2 7B fp8,或 Real-ESRGAN x4plus | 邊緣清楚的畫面是 7B 唯一明顯贏 3B 的地方 |
| 動漫、插畫 | Real-ESRGAN anime 6B / 4x-AnimeSharp / SeedVR2 3B | 專用模型線條乾淨,SeedVR2 分數也好 |
| 自己生的 AI 圖想補細節 | FaceDetailer(Krea2)/ Ultimate SD Upscale | 補最多紋理,但會改臉——真人照片別用 |
完整對照圖
以下是 22 組完整對照(37 條路線 1:1 局部),依序是 12 題的 256 像素等級、7 題的仿老照片等級、3 張真老照片。每張圖第一格是輸入、第二格是原圖(真老照片沒有原圖)。






















模型下載
| 模型 | 放哪裡 | 來源 |
|---|---|---|
| SeedVR2 3B ema fp16、VAE | models/SEEDVR2/ | numz/SeedVR2_comfyUI;節點 ComfyUI-SeedVR2_VideoUpscaler |
| SeedVR2 7B fp8(一般/sharp) | models/SEEDVR2/ | AInVFX/SeedVR2_comfyUI |
| FlashVSR 1.1 | 節點自動下載 | ComfyUI-FlashVSR_Ultra_Fast |
| 4x-UltraSharp、4xNomos8kSCHAT-L、2xNomosUni SPAN、4xFFHQDAT、4xFaceUpLDAT、4x-ClearRealityV1、4x-AnimeSharp | models/upscale_models/ | OpenModelDB |
| Real-ESRGAN x4plus / x2plus / anime 6B | models/upscale_models/ | xinntao/Real-ESRGAN releases |
| GFPGAN v1.4 | models/facerestore_models/ | TencentARC/GFPGAN releases |
| CodeFormer v0.1.0 | models/facerestore_models/ | sczhou/CodeFormer releases |
| GPEN-BFR 512 / 1024 / 2048 | models/facerestore_models/ | Gourieff/ReActor 模型庫;節點 ComfyUI-ReActor(Restore Face 節點) |
| FaceDetailer | — | ComfyUI-Impact-Pack(搭 face_yolov8m 偵測器) |
| Ultimate SD Upscale | — | ComfyUI_UltimateSDUpscale |
相關文章
- ComfyUI 去背模型大評比:30 條路線同圖實測——同一套方法的上一篇


