2026年10月6日
AI 影片 4K 製作:直接生成 4K,還是事後放大?
大多數影片模型輸出的解析度是 720p 或 1080p。Seedance 2.0、Veo 3.1 Fast 和 Kling V3 的原生 4K 要付多少代價、用 ByteDance 或 Topaz 放大又要付多少代價、各模型的精算對照,以及放大永遠補不回來的東西。

Frank HoubreImaginode 創辦人
大多數 AI 影片輸出都是 720p
在目錄中的十七款影片生成模型裡,只有三款提供 2160p 等級:Kling V3、Veo 3.1 Fast 和 Seedance 2.0;Seedance 2.5 的上限是 720p,Wan 3.0、Flux 3 Video 和 Grok Imagine Video 1.5 則是 1080p。
發布公告裡經常大談 4K,但規格表裡卻少提得多。幾乎所有影片模型的預設等級都是 720p,也就是橫向 1280 × 720。這是 2010 年 YouTube 影片的解析度。在手機上還能接受,但放到電視或投影螢幕上,馬上就看得出差別。
逐一來看各模型:需求量最高的模型之一 Seedance 2.5 只提供 480p 和 720p,再往上就沒有了。Wan 3.0、Flux 3 Video 和 Grok Imagine Video 1.5 可到 1080p。只有 Kling V3、Veo 3.1 Fast 和 Seedance 2.0 提供真正的 2160p,也就是螢幕上所謂的 4K。
如果您的成品必須是 4K,就有兩條路可走。選擇這三款原生支援 4K 的模型之一,或者用您想用的模型生成,再進行放大。兩種方式都有代價,得到的結果也不一樣。以下是具體數字。
原生 4K 的代價
Seedance 2.0 五秒影片在 720p 要 60 點數,2160p 要 330 點數;Veo 3.1 Fast 八秒影片在 1080p 要 144 點數,2160p 要 336 點數;Kling V3 不論解析度,五秒都是 152 點數。
在 Seedance 2.0 上,解析度的計費差異很直接:五秒 480p 要 36 點數,720p 要 60 點數,1080p 要 150 點數,2160p 要 330 點數。4K 的價格是 720p 的五倍半。若是十秒的鏡頭,就會從 120 點數躍升到 660 點數。
在 Veo 3.1 Fast 上,720p 和 1080p 的價格相同,八秒含音效要 144 點數,而 2160p 則上升到 336 點數。也就是說,這裡的 1080p 相對 720p 是「免費」的,但 4K 的價格卻超過兩倍。
還有一個格外划算的例外:Kling V3 在 720p、1080p 和 2160p 之間,每秒的計費完全相同。五秒含音效 152 點數,不含音效 101 點數,不論畫質高低皆如此。如果您使用 Kling V3 卻仍停留在預設的 720p,那麼每次生成都在白白浪費免費的 4K。
放大要花多少
ByteDance Upscaler 把五秒影片放大到 4K 只要 18 點數,十秒要 35 點數,一分鐘要 208 點數;Topaz Proteus 則依輸出等級計費,只要輸出達到 4K,五秒就要 36 點數。
「增強」節點在影片模式下提供兩種放大工具。第一種是 ByteDance Upscaler,以目標解析度設定:1080p、2K 或 4K。放大到 1080p,五秒要 5 點數;到 2K 要 9 點數;到 4K 要 18 點數。整整一分鐘的 4K,也就是它的上限,共需 208 點數。
第二種是 Topaz Proteus,以倍率設定,×2 或 ×4,並依產出影片的等級計費:若輸出維持 720p,五秒要 6 點數;1080p 要 12 點數;一旦達到 2160p,則要 36 點數。將 1080p 放大 ×2,恰好得到 3840 × 2160,五秒只要 36 點數。將 720p 放大 ×4,則會輸出 5120 × 2880,超過 4K,但價格相同。
我們在產出檔案上實際驗證過,兩者都會保留來源的音軌:由 Veo 或 Seedance 生成的聲音完整無缺地保留下來。兩者都能接受一到六十秒長度的片段。而且在這兩種工具裡,啟動前按鈕上就會顯示依據所接影片實際長度算出的價格。
各模型的精算對照
若要五秒 4K:Seedance 2.0 先以 720p 生成再用 ByteDance 放大只要 78 點數,原生則是 330 點數;Veo 3.1 Fast 先以 1080p 生成再放大,八秒要 172 點數,原生則是 336 點數;Kling V3 原生 2160p 維持 152 點數,根本不需放大。
先看 Seedance 2.0,因為它的差距最驚人。原生 4K:五秒 330 點數。720p 再用 ByteDance 放大到 4K:60 加 18,也就是 78 點數。便宜四倍。即使從 1080p 開始,150 加 18 等於 168,也只是原生價格的一半。
接著看 Veo 3.1 Fast 的八秒鏡頭。原生 4K:336 點數。1080p(與 720p 同價)再用 ByteDance 放大到 4K:144 加 28,等於 172 點數。略高於一半的價格。至於 Seedance 2.5,這個問題根本不存在:它沒有高於 720p 的等級,所以五秒 120 點數,再加放大到 4K 的 18 點數即可。至於 Wan 3.0:720p 的 60 點數加 18 等於 78 點數,比從 1080p 開始的 138 點數便宜不少。
Kling V3 是唯一答案反過來的情況:2160p 的價格和 720p 相同,所以直接生成 4K,完全不需要放大。若要逐個鏡頭精算您自己的專案,計算器 會依模型、時長和解析度算出費用,而「增強」節點則會依您所接影片的實際長度顯示價格。
原生與放大:畫面上的差異
以 4K 生成的鏡頭,其細節是模型在生成時當場決定的;放大的鏡頭只能讓 720p 原有的內容變得更清晰,而一張只有三十像素高的臉,放大後依然只有三十像素高。
我們得老實說明放大工具能做到什麼。它不會重新生成場景。它只是把片段的每一張畫面,讓邊緣更銳利、紋理更細緻,但始終忠於原有的內容。在近景鏡頭中,臉部占滿畫面一半,或是近距離拍攝的產品,效果會非常出色,因為資訊在 720p 時就已經存在了。
但遠景鏡頭就不一樣了。在 720p 畫面中,一個角色只占畫面高度十分之一時,他的臉大約只有三十像素高。沒有任何放大工具能在那裡找到眼睛、表情或睫毛。而直接以 4K 生成的模型,則是在生成的那一刻就決定好這些細節。在包含人物的遠景鏡頭上,原生生成仍占有真正的優勢。
下方的截圖以一個刻意刁難的案例來說明:一段 480 × 270 像素的片段,放大四倍到 1920 × 1080,再以 100% 裁切到孩子的臉部。傳統的放大方式畫面模糊。ByteDance Upscaler 讓邊緣變得非常銳利,但同時也讓顆粒感和壓縮瑕疵變得更明顯。Topaz Proteus 則給出更柔和、更自然的畫面,但細節並沒有增加。而在這三種結果裡,那張臉始終是一團帶著微笑的模糊色塊:因為來源本身就沒有這份資訊。
該選 ByteDance 還是 Topaz
ByteDance Upscaler 最便宜也最銳利,但有可能讓瑕疵更明顯;Topaz Proteus 更柔和,更忠於原始畫面,但放大到 4K 時價格是兩倍。
對於乾淨、沒有經過嚴重壓縮的 AI 生成影片來說,ByteDance Upscaler 的表現非常出色,而且只要一半的價格。它的設定方式很簡單,直接選目標:1080p、2K 或 4K,完全不用自己計算。這是我們把 Seedance 或 Wan 的鏡頭放大到 4K 時的預設選擇。
Topaz Proteus 則適合在來源本身有您不想讓它更明顯的瑕疵時使用:例如已經被壓縮、下載、多次重新編碼的影片,或帶有噪點的畫面。它的作用更偏向柔化,而非銳化。在我們的測試片段上,ByteDance 輸出為每秒 30 格,Topaz 則保留了來源的 25 格,不過現在兩者的輸出幀率都在節點中選擇,可設為 24、25、30、50 或 60:請設成與您剪輯相同的幀率。
如果不確定該選哪個,畫布可以用幾點數就幫您做出判斷:把同一段五秒片段分別接到兩個「增強」節點,一個用一種放大工具,再比較結果。放大到 1080p 只要 5 點數和 12 點數,這個測試的花費比一次失敗的生成還便宜。這兩款工具的詳情,以及市面上其他選項,都收錄在最佳 AI 影片放大工具一文中。
何時 4K 根本沒有意義
對於以 1080 × 1920 顯示、並由平台重新編碼的 TikTok、Reels 和 Shorts 來說,4K 根本看不出來;它真正有價值的場合是大螢幕放映、交付給客戶、正式播送,以及後期的重新裁切。
先說個對您預算有利的好消息:大多數 AI 影片最終都是在手機上觀看的。TikTok、Reels 和 Shorts 最高也只顯示 1080 × 1920,而且會把您上傳的任何內容重新編碼。用 ByteDance 把 720p 鏡頭放大到 1080p,五秒只要 5 點數,已經綽綽有餘。在這裡用 4K,等於白花錢。各平台確切的尺寸規格,可參考該生成什麼格式與解析度。
4K 在四種情況下才真正有價值。第一,用於大螢幕放映,例如電視、投影或專業客廳螢幕。第二,交付給在需求文件中明確要求的客戶。第三,YouTube,許多創作者會匯出 4K,因為平台會用更高的位元率重新編碼解析度更高的來源,這通常會讓即使以 1080p 觀看的觀眾也看到更好的結果。第四,重新裁切。
重新裁切值得特別一提,因為這是最聰明的用法。一段 3840 × 2160 的 16:9 鏡頭,其中已經包含一段 1215 × 2160 的直向畫面,超過社群平台所需的 1080 × 1920。換句話說,只要把一個橫向鏡頭放大到 4K,您就能同時得到 YouTube 版本和 Reels 版本,不用重新生成,只需在剪輯時選取直向取景範圍即可。
方法:先用低解析度確認,再放大最終鏡頭
先用 480p 或 720p 探索,選定想要的鏡頭,只放大保留下來的鏡頭,再進行剪輯:如果在選定之前就先放大,等於是為那些最終會被丟棄的鏡頭多付了 4K 的錢。
AI 影片是靠反覆嘗試做出來的。同一個鏡頭生成十次,通常只會留下一兩次。若在 Seedance 2.0 上直接以原生 4K 生成這十次嘗試,五秒影片就要花 3300 點數。若改用 480p 生成,只要 360 點數,而動作、取景、角色一致性在這個解析度下也能看得清清楚楚,完全足以判斷。
一旦選好鏡頭,接下來依模型不同有兩種做法。如果更高等級幾乎不用多花錢,例如 Kling V3 的 2160p 或 Veo 3.1 Fast 的 1080p,就用同樣的指令和同一張起始畫面,重新生成一次選定的鏡頭,直接達到該等級。否則,就把這個鏡頭接上「增強」節點,放大到 1080p 或 4K。
剪輯則留到最後。這個放大工具每次最多可處理六十秒,足以涵蓋任何生成出來的鏡頭。將保留的每個鏡頭逐一放大,再放進「剪輯」節點組合起來。對於超過單一鏡頭長度的影片,串接的方法詳見製作超過 10 秒的 AI 影片一文。
總結
Kling V3:原生 4K 的價格等於 720p。Seedance 2.0、Wan 3.0、Seedance 2.5:先以 720p 生成,再用 ByteDance 放大到 4K,五秒只要 18 點數。Veo 3.1 Fast:先 1080p,再放大。至於社群平台,1080p 就已經足夠。
如果您的模型是依解析度計費,放大幾乎總是比直接生成 4K 便宜:在 Seedance 2.0 上便宜四倍,在 Veo 3.1 Fast 上便宜一半。如果您的模型不依解析度計費,例如 Kling V3,就直接以最高等級生成。
放大工具在近景鏡頭和乾淨的來源上表現極佳。但它無法還原遠景鏡頭中微小角色的臉部:在這類鏡頭上,原生生成仍占優勢,也正是它物有所值的地方。
無論如何,都應該先用低解析度探索,選定之後,才在真正要進入正式製作的那個鏡頭上提升畫質。若是靜態照片而非影片,同樣的道理也適用,只是數字不同,詳見將 AI 圖像放大以供大圖輸出一文。
餘額