月費方案享 9 折,優惠碼 NODE10,至 8月31日 止

Imaginode
部落格

2026年8月12日

第一支 AI 影片:不讓預算爆掉的方法

一支 AI 影片依模型和解析度要花 26 到 330 點。這裡教你在動畫化之前先用 1 到 7 點以圖片定稿,聰明設定長度與解析度,並避開一個晚上就掏空帳戶的錯誤。

第一次嘗試的陷阱

直接文字轉影片,等於花 26 點去發現一個用靜態圖一歐分就能驗證的構圖:正確做法是先用圖片定稿,再讓它動起來。

場景很典型。週五晚上,腦中有個短片點子,你打開影片生成器,輸入「一名騎士在日出時穿過起霧的森林」,按下生成。等三分鐘。結果出來了:騎士是背對鏡頭的,森林像市立公園,霧完全不見了。二十六點就這樣飛了,而你連一個能用的鏡頭都沒有。

問題不在模型。生成這名失敗騎士的 Kling 2.5 Turbo 是很好的生成器。問題在方法:直接文字轉影片,等於用動畫的全額價錢,去發現一個你本來花一歐分用靜態圖就能驗證的構圖。這就像為了重讀第一章而把整本書印出來。

這篇文章講的是反過來的做法,也是那些用每月 13 歐元 Starter 方案就能撐一個月的創作者在用的方法:每個鏡頭先用圖片定稿,再讓那張圖動起來。附上真實數字、真實的失敗率,以及 Imaginode 什麼情況退點、什麼情況不退。

一次影片生成到底要多少錢

Kling 2.5 Turbo 5 秒約 26 點,Seedance 2.0 Fast 約 48 點,4K 最高到 330 點;相對地一張圖片只要 1 到 7 點,至少是三十倍的差距。

先把數量級擺出來,因為後面所有的推論都從這裡來。在 Imaginode 上,1 點約等於 0.01 歐元。Kling 2.5 Turbo 5 秒大約 26 點,也就是 0.26 歐元。Seedance 2.0 Fast 在 720p 下 5 秒約 48 點。而完整版的 Seedance 2.0 在 4K 下,5 秒約 330 點:一段短片超過 3 歐元。

相對地,一張圖片從 1 點(Flux Schnell)到 7 點(Flux 2 Pro)。換句話說,一支失敗的影片,等於四、五輪完整的圖片探索,每輪還能試十來次。這個一比三十、有時一比三百的比例,是你按下生成之前唯一該記住的統計數字。

有一道護欄:確切花費會在你點擊之前顯示在生成按鈕上。帳單不會有意外,價格在你做決定的當下就白紙黑字寫在那裡。養成看它的習慣。很多新手是事後才發現,自己順手啟動了一個高階模型。

為什麼直接文字轉影片是在賭博

一段直接的影片提示詞一次外包了五個決定,全都要付錢之後才看得到,而且大約每三、四次就有一次進垃圾桶,難看但已交付的結果照樣算錢。

當你把提示詞直接丟給影片模型,你等於把一切都交給它:構圖、光線、角色的臉、色調,還有運動。一次五個決定,而且要付錢之後才看得到。從機率上說,只要其中一個失手,這個鏡頭就不能用了。

而且要說得直接一點:AI 影片現在仍然常常失敗。大約每三、四次生成就有一次進垃圾桶,可能是手變形、畫面上的文字融掉,或是物理很可疑,例如玻璃杯直接穿過桌子。一次 48 點的嘗試,每次失敗都很有感。直接試三次,你就花了 144 點,也許只換到兩個堪用的鏡頭。

還有一件事要先知道:難看但技術上已交付的結果,還是要付錢。只有供應商端的技術性失敗才會退點。平台不會評判你的騎士好不好看,它只確認檔案存在。所以重點在於,盡量減少影片模型可能失手的地方。

方法:先用圖片定稿

永遠不要叫影片模型自己想構圖:先花 1 到 7 點確定一張圖,在節點紀錄裡比較,再把它當成影片的第一格。

原則一句話就講完:永遠不要叫影片模型發明構圖,只要它讓一張你已經核可的圖片動起來。在 Imaginode 的畫布上加入一個圖片節點,寫下提示詞,生成。幾秒後結果就出來,依模型不同只要 1 到 7 點。

圖片不滿意?改提示詞再跑一次。每個節點都保留最近 12 次生成的紀錄,你可以並排比較,第八版不如第三版就退回第三版。這是影片給不起的奢侈,因為在影片裡,每一次比較至少要 26 點。

等到圖片完全是你要的樣子,構圖也對了,它就成為影片的第一格。這時影片模型只剩一件工作:讓已經存在的東西動起來。你剛剛把一場五個未知數的賭局,變成只有一個未知數。

第一格該用哪個圖片模型

用 1 點的 Flux Schnell 抓大方向,再用 6 點的 Flux Pro 1.1 或 Imagen 4 定稿,固定角色則用 5 點的 Seedream 5 Lite:全部大約十五點。

抓大方向時,1 點的 Flux Schnell 無人能敵。十次構圖嘗試只要 10 點,也就是 0.10 歐元。它是最理想的拋棄式草稿:快、細節不一定精緻,但足以判斷構圖和光線。

構圖確定之後,再用更講究的模型重新生成最終版:6 點的 Flux Pro 1.1 或 Imagen 4,想把細節拉到最滿就用 7 點的 Flux 2 Pro。如果你的鏡頭裡有一個定義在參考節點裡的固定角色,5 點的 Seedream 5 Lite 是最忠於參考圖的冠軍。

一輪認真探索的總帳:含草稿大約十五點。比一支失敗的 Kling 影片還便宜。而且你進入動畫階段時,握有直接文字轉影片永遠給不了你的把握:你已經知道自己的鏡頭長什麼樣子。

把圖片接到影片節點上

一條從圖片節點拉到影片節點的線就固定了第一格:構圖、光線和臉都被鎖住,模型只剩運動可能出錯。

在畫布上,從圖片節點的輸出埠拉一條線到影片節點。接上時輸入端的圓點會亮起,表示連線生效。如果你把線鬆手在節點上的任意位置,它會自動接到最可能的輸入,也就是起始圖片。

影片節點會依你選的模型顯示不同的輸入。起始圖片永遠只有一個,用來固定第一格。有些模型也接受結束圖片,很適合做可控的轉場。而參考圖則能維持角色一致:Seedance 2.0 最多 9 張,Seedance 2.5 更多。

接上起始圖片之後,構圖、光線和臉都被鎖住了。可用鏡頭的比例會比純文字明顯提高,因為模型只剩運動這一項可能出錯。順帶一提:Seedance 在圖片轉影片時有自己的解析度限制,平台會替你調整好。

先用 5 秒 720p,之後再往上加

所有測試都用 5 秒 720p:同一個 Seedance 2.0 鏡頭從 720p Fast 的 48 點跳到 4K 的約 330 點,等於為一次測試多付將近七倍。

長度和解析度是兩個會把預算炸掉的滑桿。驗證時調到最低,交付時才調到最高。具體來說:所有運動測試都用 5 秒、720p。要判斷騎士是自然地走路,還是像西洋棋子一樣在地上滑,這已經綽綽有餘。

價差讓這個紀律很值得。在 Seedance 2.0 上,同一個 5 秒鏡頭從 720p Fast 的約 48 點,跳到完整版 4K 的約 330 點。為一次可能會丟掉的測試多付將近七倍。4K 是留給最終版、留給你要匯出的那一支。

長度也是同樣的邏輯。Seedance 2.5 可以做到 30 秒的片段,這很了不起,但一次 30 秒的失敗,等於六次 5 秒的失敗。把場景拆成短鏡頭,一個一個驗證,長鏡頭留給已經驗證過的運動。

新手該用哪個影片模型

兩個穩當選擇:Kling 2.5 Turbo 5 秒約 26 點適合學習,Seedance 2.0 Fast 48 點質感更細;學習期間就固定用一個模型。

Imaginode 提供 47 個模型,全部用同一套點數支付,換供應商只要兩下點擊,不必再訂閱一次。第一個晚上,有兩個穩當的選擇。Kling 2.5 Turbo,5 秒約 26 點,是學習階段性價比最高的:快、運動自然、足以判斷你的點子好不好。Seedance 2.0 Fast,約 48 點,質感更細膩。

目錄裡其他名字之後再說。想要生成音訊時找 Veo 3.1 Lite 和 Fast,要上 1080p 或 4K 時找完整版 Seedance 2.0,需要多張參考圖或最長 30 秒的片段時找 Seedance 2.5。Grok Imagine Video、MiniMax H3、Wan 2.7、Kling V3 或 PixVerse 各有強項,但第一支短片沒有一個是必需的。

我們的建議很直接:學習期間就固定用一個模型。每個生成器都有自己的脾氣、自己解讀推軌或光線的方式,而你只有累積可以互相比較的嘗試才會進步。每個鏡頭換一個模型,等於每個鏡頭都從零開始,學費還付好幾遍。

描述運動,而不是畫面

圖片已經帶著構圖了:只描述會動的東西,主體、鏡頭、節奏,運鏡寫成最後一句,5 秒的鏡頭只放一個動作。

你的圖片已經帶著構圖,所以不要在影片提示詞裡再重複一遍。只描述會動的東西:主體、鏡頭、節奏。「騎士緩緩走向鏡頭,斗篷在風中擺動,前景有落葉飄下。」一句清楚的運動描述,勝過一整段重複的畫面描述。

把運鏡寫成明確的最後一句,模型對這種寫法的反應,比對埋在句子中間的形容詞好得多。份量也請保守:一個會動的主體加一個運鏡,對 5 秒來說已經很多了。堆了四個動作的提示詞,只會產出一團糊。

如果技術英文讓你卻步,提示詞欄位上的魔法棒會透過 Kimi 模型把你的文字改寫成豐富有結構的英文,只要 1 點。它會保留你的角色 @提及。花 1 點讓一次 48 點的生成更可靠,這帳很好算。

說老實話,現在還是會失敗的部分

就算起始圖片很乾淨,也要抓每三、四次失敗一次:手變形、文字融化、物理可疑;對策是挑選能避開這些陷阱的鏡頭。

沒有任何方法能讓 AI 影片萬無一失,說有的話就是在騙你。就算起始圖片很乾淨,大約每三、四次生成仍會失敗一次。手還是第一號弱點:手指黏在一起、多出來的拇指、握著的物件變形。

畫面上的文字是另一個經典墳場。在你的起始圖片上還清楚可讀的招牌,很有可能從動畫第二秒就融成象形文字。物理也還很粗糙:違抗重力的液體、滑步的角色、互相穿透的物件。

對策主要在鏡頭的選擇。避開手部動作的特寫、必須保持清楚的文字,還有像倒咖啡這種複雜的物件互動。多用臉部、走路、氛圍,以及在場景上移動的鏡頭。好的 AI 導演會挑自己要打的仗,就像沒錢的導演會挑自己拍得出來的戲。

當機退錢,難看照付

技術性失敗會在幾秒內自動退點,交付了但令人失望的影片仍然算錢:每個最終鏡頭抓兩到三次生成,也就是約 65 點。

這條規則值得講清楚,因為它決定了你的預算結構。如果生成在模型供應商端技術性失敗,例如伺服器掛掉、檔案根本沒交付,點數會在幾秒內自動回到你的帳戶。不用申請、不用舉證、沒有客訴表單。

反過來說,交付了但令人失望的影片仍然要付錢。眼神歪掉的騎士、飄得很怪的斗篷,交付了就是付了。這種不對稱不是坑人,所有模型供應商都是這樣運作的:運算確實發生了。但這也解釋了為什麼這篇文章的整套方法,目標是減少令人失望的生成,而不是期待退款。

請據此編列預算:一個最終鏡頭要抓兩到三次影片生成,不是一次。26 點的 Kling 鏡頭一次就過,是驚喜,不是工作假設。以平均 2.5 次計算,你那個 5 秒鏡頭大約要 65 點,也就是 0.65 歐元。

三個很花點數的新手錯誤

沒有參考節點就想動固定角色、什麼都不改一直重跑同一段提示詞,以及跳過 720p 的 48 點直接衝 330 點的 4K:三個經典陷阱。

第一個錯誤:沒有參考圖就想讓固定角色動起來。沒有參考圖,臉每次生成都不一樣,你只是在燒點數追一個模型根本無從得知的相似度。建立一個參考節點,給它名字、描述和幾張照片,然後在提示詞裡 @提及它:描述會被注入,照片也會自動附上。

第二個錯誤:一直重跑同一段提示詞,期待奇蹟。如果連續兩次都在同一個地方失敗,問題出在需求本身,不是在抽籤。在再付 26 點之前,明確改掉某個東西:少一個動作、換一個更簡單的運動。節點的紀錄會清楚告訴你已經試過什麼。

第三個錯誤:一開始就直接生成高解析度的正式版。「反正要一次做好」這種反射,在 Seedance 2.0 的 4K 上每次嘗試約要 330 點,而在 720p 驗證只要 48 點。先在 720p 一次做好,再放大重生成一次就好。

生成音訊:Veo 這個案例

Veo 3.1 Lite、Fast 以及 Kling V3 會連聲音一起生成:氛圍鏡頭很好用,但如果你的短片最後要配音樂,就是白花錢。

有些模型已經不只做畫面。Veo 3.1 Lite 和 Fast 會連聲音一起生成:環境音、音效,有時還有台詞。一個下雨的鏡頭會附帶雨聲,一個市場會附帶人聲的嘈雜。Kling V3 也提供音訊。對社群平台的短影音來說,這省下一整輪音效設計。

開啟音訊之後費用當然會上升,確切價格一如往常顯示在生成按鈕上。每個鏡頭之前先問自己:如果這支短片最後會配上音樂剪出來,生成的音訊就會被丟掉。為了一條你等等要靜音的軌道多付錢,沒有任何意義。

我們的看法很直接:生成音訊在氛圍鏡頭和簡單的對白場景上很出色,凡是需要精準同步的地方就還會讓人失望。挑一個鏡頭試試,聽一聽,再決定。這種取捨是用耳朵判斷的,不是看規格表。

用攝影機節點更上一層

五個轉盤會把正確的英文術語寫在提示詞開頭、把運鏡寫在結尾:同一個攝影機節點可以餵給多個生成器,讓整體調度保持一致。

掌握了先圖片再影片的方法之後,攝影機節點是你的下一階。五個圖示化的轉盤:景別、鏡頭焦距(毫米)、光圈、角度、運動,節點會替你把正確的英文術語寫在提示詞最前面,也就是模型權重最高的位置。

對影片的好處非常直接:運動轉盤提供固定鏡頭、推軌前進或後退、橫搖、升降、環繞、手持或緩慢變焦,並把它寫成提示詞最後一句明確的敘述。從此不再有那種什麼都生不出來的模糊 cinematic camera movement。

同一個攝影機節點可以同時餵給好幾個生成器,讓開場鏡頭和下一個鏡頭的調度保持一致。我們為此寫了一整篇:「像攝影指導一樣指揮 AI」,裡面有每個設定的實際效果。先從簡單的開始:中景、35 mm、緩慢推軌前進。

第一個晚上的預算範例

三個 5 秒鏡頭,含探索和重試大約 205 點,也就是 2 歐元,不到每月 13 歐元(未稅)Starter 方案 900 點的四分之一。

來算一次真實的探索過程:一位創作者想要三個 5 秒鏡頭做預告片。用 Flux Schnell 探索構圖:三十來張圖,30 點。三張圖用 Flux Pro 1.1 做最終版:18 點。用 Kling 2.5 Turbo 動畫化,每個鏡頭平均兩次嘗試:約 156 點。合計:大約 205 點,也就是約 2 歐元。

每月 13 歐元(未稅)的 Starter 方案和它的 900 點來算,這個晚上用掉不到當月預算的四分之一。經常拍片的創作者會升到 Creator 方案,未稅 42 歐元、3,100 點。臨時的高峰則可以買加值包,從 1,000 點 15 歐元起跳。

跟直覺做法比較看看:三個鏡頭直接在 Seedance 2.0 Fast 上文字轉影片,以一般的失敗率計算,會吃掉 400 到 500 點,結果還更不可控。這套方法不只便宜,成品也更好。

現在,換你的第一個鏡頭

今晚就做:十張 Flux Schnell 草稿、一張定稿,拉一條線到 Kling 2.5 Turbo,5 秒 720p;接好線的範本和 1 點一則的助理可以幫你把工作流搭好。

把今晚要做的事整理一次。一個圖片節點,十張 Flux Schnell 草稿,一張乾淨的最終版。拉一條線到影片節點,選 Kling 2.5 Turbo 或 Seedance 2.0 Fast,5 秒,720p。一句清楚的運動描述。全部都會自動儲存,你甚至可以從手機瀏覽器送出生成,鎖上螢幕它也會繼續跑。

如果你想從已經搭好的基礎開始,現成範本裡就有接好線的圖片轉影片流程,例如虛擬家居軟裝,它會把一個房間的變身動畫化:你只要換掉提示詞,其他都在位子上了。而右下角泡泡裡的助理,看得到你打開的畫布,每則訊息 1 點就能替你把整個工作流搭起來。

想走得比第一個鏡頭更遠,說明文件裡的學院提供 YouTube 影片課程,把整條流程實際操作給你看。這個部落格建議的下一站:攝影機節點那一篇,因為一個動得好的鏡頭,首先是一個構圖好的鏡頭。

想在真正的畫布上試試嗎?

本文提到的一切,都能在瀏覽器裡用 Imaginode 完成。

開始使用