2026年8月12日
像攝影指導一樣指揮 AI:改變一切的鏡頭、構圖與運鏡
圖像與影片模型是在數百萬張附有電影詞彙說明的照片上學會的。用 85mm、f/1.4 和仰角跟它們說話,它們就會照做。Imaginode 的攝影機節點替你把這些術語寫在提示詞最前面,也就是它們份量最重的位置。
你的提示詞缺的那個詞
「close-up, 85mm lens, f/1.4」這幾個技術字眼,就足以把一張隨便構圖的肖像變成背景化開的特寫:這是攝影指導的詞彙。
拿兩段提示詞來比。第一段:「一位紅髮女子在咖啡館裡的肖像」。第二段:「close-up, 85mm lens, f/1.4,一位紅髮女子在咖啡館裡的肖像」。第一段給你一張還可以的圖,構圖隨機,背景還跟主角搶戲。第二段給你一張緊湊的肖像,背景化成一團團光斑,眼神銳利。同一個主題,差幾個字,兩張毫不相干的圖。
這幾個字不是什麼咒語。它們是攝影指導在開拍前會交代給攝影助理的術語。而事實是,AI 模型對它們的理解好得驚人,原因很具體,我們接著說。
這篇文章會逐一檢視每個設定和它在畫面上的實際效果,示範 Imaginode 的攝影機節點如何替你寫下所有這些術語,最後談多鏡頭真正的難題:怎麼讓每個鏡頭維持同一套鏡頭語言。
模型為什麼懂電影詞彙
模型是在數百萬張由攝影師撰寫說明的圖片上訓練的:「85mm」或「low angle shot」會喚起非常明確的成像效果,比「漂亮的專業照片」可靠得多。
圖像和影片模型是在數量龐大的帶說明照片與影片片段上訓練出來的。那麼,誰會仔細替自己的圖片寫說明?攝影師、圖庫、器材評測網站。他們的描述裡滿是技術用語:「shot on 85mm」、「f/1.4」、「low angle shot」、「dolly in」。
結果就是,這些詞對模型來說不是裝飾:它們在統計上連結到非常鮮明的成像風格。寫下「85mm」,就等於召喚模型看過的所有 85 mm 肖像,連同它們的透視壓縮和柔化背景。這比「漂亮的專業照片」可靠太多了,後者根本對應不到任何特定的畫面。
實務上的結論,對攝影出身的人是好消息,對其他人有點洩氣:有效的提示詞長得像一張英文的拍攝通告。好消息是,你不需要把它背下來。
攝影機節點:五個轉盤,零術語需要記
五個附圖示的轉盤,構圖、鏡頭、光圈、角度和運鏡,替你寫下英文術語,並把它們放在提示詞最前面,也就是模型最買帳的位置。
在 Imaginode 的畫布上,攝影機節點用五個附圖示的轉盤取代死背:構圖、以毫米為單位的鏡頭焦距、光圈、角度和運鏡。你一邊看縮圖一邊轉轉盤,節點就替你寫出對應的正確英文術語。你不需要知道美式中景的英文是「cowboy shot」。
一個關鍵細節:這些術語會插在提示詞最前面,放在你的場景描述之前。模型對提示詞開頭給的權重比較高,所以放在第一順位的設定,會比同一個設定淹沒在句尾要被遵守得多。至於運鏡,則會以明確的句子加在最後,這是影片模型最容易照做的形式。
接著像接任何一個輸入一樣,把攝影機節點接到圖像節點或影片節點上:一條線、圓點亮起,就完成了。同一個攝影機節點可以同時餵給多個生成器,後面會再談,這是多鏡頭一致性的祕密武器。
六種構圖,以及它們各自在說什麼
從製造張力的大特寫,到鋪陳一個世界的大遠景,構圖共有六種:交替使用它們,別讓整段都是模型預設的中景。
構圖是第一個決定,它定義了觀眾在看什麼。轉盤提供六種。大特寫把一個細節單獨挑出來,一雙眼睛、一隻放在門把上的手,製造張力。特寫框住臉:這是情緒的構圖,是讓一個角色真正存在的構圖。
中景切在腰部,適合對話和動作細節。美式中景切在大腿中段,來自西部片,因為得看得到左輪手槍,至今仍是呈現某人正在行動最自然的構圖。遠景把角色放進他的場景裡。大遠景則讓角色被巨大的環境壓住:拿來當故事的開場再適合不過。
新手常犯的錯,每天都看得到:全部生成中景,也就是你什麼都不指定時模型的預設構圖。整段影片都跟主體維持同樣的距離,不管模型多厲害都是平的。交替使用:一個大遠景交代地點,一個美式中景給動作,一個特寫給反應。
鏡頭:14 mm 會變形,135 mm 會壓縮
轉盤從 14 走到 135 mm:廣角拉長透視,50 mm 接近人眼所見,長焦則壓縮景別層次,做出最有電影感的畫面。
鏡頭轉盤從 14 走到 135 mm,這個數字會改變畫面的幾何本身。14 mm 涵蓋極大的視野,並且拉長透視:線條往外奔去,前景變得巨大。拍建築或狹窄的室內很棒,拍臉很殘忍,會像哈哈鏡一樣把人扭曲。
24 mm 和 35 mm 是報導攝影的鏡頭:夠廣,能交代環境;夠收斂,不會變形。50 mm 大致重現人眼的透視,因此有標準鏡頭的外號。它是中性的選擇,除了場景本身之外什麼都不多說。
再往上就是長焦的壓縮。135 mm 在視覺上把各個層次拉近彼此:山看起來就貼在角色背後,車陣變成一面密實的牆。這種壓縮加上背景虛化,做出整組裡最有電影感的畫面。同一條街道分別用 24 mm 和 135 mm 各拍一次:你會不敢相信那是同一個地方。
85 mm,肖像最好的朋友
85 mm 幾乎讓每一張臉都好看,而特寫加 85 mm 加大光圈的組合,幾乎一定會給你眼睛銳利、背景化開的肖像。
如果這篇文章你只記得一個數字,請記住 85。85 mm 是名副其實的肖像焦段:夠長,能稍微壓平五官,這幾乎讓每一張臉都更好看;又夠短,能在主體後面留一點環境。鼻子看起來比 24 mm 下更秀氣,比例也更正確。
AI 模型看過數百萬張標註「85mm」的肖像,所以這個詞是整套詞彙裡最有力的之一。在圖像節點上,特寫加 85 mm 加大光圈的組合,幾乎一定會給你一張眼睛銳利、背景化開的肖像,也就是大家會聯想到高階婚紗照的那種質感。我們的免棚拍時尚攝影工作流就靠這組設定撐著,同一位模特兒得在同一顆鏡頭下擺出好幾個姿勢。
一個產品頁專案上的親身經驗:同一段肖像提示詞,用 6 點的 Flux Pro 1.1,先不做設定,再用攝影機節點設成 85 mm f/1.8。第一個版本堪用。第二個版本被客戶當成棚拍照片。整組比較總共 12 點,換來一個記很久的教訓。
光圈:f/1.4 把主體挑出來,f/16 讓一切都看得見
光圈掌控景深:f/1.4 把主體從模糊的背景中分離,f/8 或 f/16 讓風景全部清晰;光圈永遠要和構圖搭配。
光圈轉盤從 f/1.4 走到 f/16,它只掌控一件看得見的事:景深。規則很簡單,光圈越大,背景越模糊。在 f/1.4 下,只有主體是清楚的,背景化成柔和的色塊和光斑。在 f/16 下,從前景到地平線通通清晰。
f/1.4 是分離主體的工具:一張臉從雜亂的背景中被抽出來,一件產品從堆滿東西的桌上被抽出來。它也是公開的遮醜工具:當模型把背景生得馬虎時,模糊會很優雅地把它蓋掉。很多創作者就是為此使用它,只是不明說。
反過來,f/8 或 f/16 服務的是風景和建築,這些場合每一個層次都得看得清楚。注意前後一致:要一個 f/1.4 的山景大遠景本身就自相矛盾,模型只好隨便給你一個答案。緊的構圖配大光圈,廣的構圖配小光圈:養成這個反射動作,九成的情況就解決了。
角度:把主體英雄化,或把他壓扁
仰角放大並英雄化,俯角壓扁並孤立,正俯視把場景變成平面構成,傾斜角則帶來不安:攝影機的每一個高度都在表態。
視平線是中性的角度,紀錄片的角度。攝影機一離開這個高度,它就開始表態。仰角,機位放低往上看,會放大主體並把他英雄化:那是超級英雄海報和雜誌封面上執行長照片的角度。視點差個十公分,你的角色就主宰了整個場面。
俯角做的是相反的事:壓扁、孤立、削弱。一個在空曠大房間裡被俯角拍下的角色,一句話都不用說就講完了孤獨。正俯視的角度,完全垂直向下,把場景變成一張平面構成,很常用在食物和排列整齊的桌面。
最後是傾斜角,刻意讓地平線歪掉,帶來不安和失衡:追逐、危機場面、有什麼不對勁的時刻。要少用,正因為它太顯眼。整支預告片都用傾斜角,主要效果是讓人暈船。
為什麼這些都得放在提示詞最前面
模型對開頭給的權重比較高:技術術語先寫,場景描述接著,運鏡放在最後一句,這正是攝影機節點自動套用的結構。
提示詞不像合約那樣被閱讀,每個字份量相同。模型比較重視文字的開頭,這個權重會往後遞減。放在第一順位的「low angle shot」會被遵守;同樣的詞放在第四十個字,有時就被忽略了,尤其是在場景描述很豐富的時候。
這正是攝影機節點強制套用的結構:技術術語在前,構圖、焦距、光圈、角度,接著是你的場景描述、你的綠色角色 @提及、你的風格。而運鏡放在最後一句明確的話裡,因為影片模型處理寫成完整動作的運鏡指令,比處理形容詞要好得多。
如果你手寫提示詞,請照著這個結構寫。而如果你的提示詞是一段中文草稿,圖像節點和影片節點的魔法棒可以透過 Kimi 模型把它改寫成結構化的英文,一次 1 點,同時保留 @提及。它遵守的正是這套層級:技術在前、場景在中、運鏡收尾。
前後對比:同一個場景,有指揮跟沒指揮
同一位麵包師傅沒有指揮就是一張圖庫照片;用攝影機節點的兩組設定,她變成兩種不同的意圖,三張圖總共 9 點。
測試場景:「一位麵包師傅端出一爐剛烤好的麵包,晨光」。沒有任何指揮時,模型典型會給你一個視平線的中景,全部清晰、打光還可以、構圖像圖庫照片。技術上乾淨,看過就忘。那是訓練資料裡所有麵包店的統計平均值。
第一次用攝影機節點:特寫、85 mm、f/1.4、視平線。結果緊緊框住那張專注的臉,烤爐的水氣化成光暈,麵包成為前景一團金黃。第二次:遠景、24 mm、f/8、輕微仰角。這一次整間店都存在了,層架往深處延伸,麵包師傅成為一個場所的軸心。
兩個版本沒有哪一個比較好。它們是兩種不同的意圖,而重點正在這裡:沒有設定時,你沒有意圖,你只有平均值。整場實驗用 Imagen 4 Fast 的成本:三張圖 9 點,大約 0.09 歐元。攝影機的指揮,是整個 AI 創作裡最便宜的槓桿。
影片運鏡,一個一個看
共有八個選項,從最不容易出錯的固定鏡頭,到最可靠的慢速推鏡,中間還有推軌、搖攝、升降和環繞,環繞是模型最常搞砸的運鏡。
到了影片,第五個轉盤才登場。固定鏡頭是應該坦然接受的預設選擇:它讓場景自己活起來,也替模型省下一個出錯來源,固定鏡頭失敗的機率比複雜運鏡低。前推的推軌鏡頭朝主體靠近,製造沉浸感或威脅感;後拉的推軌鏡頭揭示環境,或是替一個場景畫下句點。
搖攝以一個軸心掃過場景,很適合揭開一處場景或跟隨一段移動。上升的升降鏡頭升到場面之上,那是電影結尾的運鏡。環繞繞著主體轉,把它變成珍貴的物件:產品廣告裡非常常用,效果壯觀但要求也高,這是模型最樂於搞砸的運鏡。
手持會加上人類的抖動,對動作場面或偽紀錄片很珍貴。最後是慢速推鏡,它幾乎察覺不到地把畫面收緊,鋪陳出一股低鳴的張力:這是最低調、大概也是生成上最可靠的運鏡。把攝影機節點接到影片節點上,運鏡的句子就會加在提示詞末尾。
什麼意圖配什麼運鏡
依照你想要的感受來選:升降給氣勢、慢速環繞給產品、手持給不安,並且遵守一條硬規則:每個 5 秒鏡頭只用一個運鏡。
正確的運鏡取決於這個鏡頭要讓人感受到什麼,而不是取決於什麼比較炫。你要開一支預告片?上升的升降或後拉推軌,替世界鋪出氣勢。你要介紹一項產品?慢速環繞或慢速推鏡,帶出精準感。你要跟著一個心神不寧的角色?手持加前推推軌,不安立刻上身。
一條靠燒點數學到的節制守則:每個 5 秒鏡頭只用一個運鏡。那些同時要求上升環繞加推鏡的提示詞,產出的是喝醉的運動軌跡。目前的影片模型能好好執行一個簡單、清楚命名的運鏡,一旦塞給它整套舞蹈編排就會迷路。
也別忘了固定鏡頭做得到什麼。在一個漂亮的鏡頭裡,樹葉間有風、角色在呼吸,這時候不動攝影機是一個場面調度的決定,不是偷懶。專業電影裡大約三分之一的鏡頭是固定的。你的 AI 影片可以照同樣的比例來。
一個攝影機節點,管好你所有的鏡頭
同一個攝影機節點可以餵給你所有的圖像節點和影片節點:六個鏡頭只有一個光學上的事實來源,轉一下轉盤就能重生成整段。
問題從第二個鏡頭就開始了:你的 A 鏡頭是 35 mm 視平線,然後你沒多想就把 B 鏡頭生成了 85 mm 仰角。剪在一起,就是一股拼貼感,卻說不上來為什麼。真正的電影撐得住,是因為有一位攝影指導把同一套光學選擇貫徹到整段戲。
在畫布上,解法是結構性的:同一個攝影機節點可以餵給多個生成器。建立一個依你的視覺識別設定好的節點,例如 35 mm、f/2.8、視平線,然後把它接到你的三個圖像節點和三個影片節點上。六個鏡頭,一個光學上的事實來源。
哪天你想換一套方向,只要在一個節點上轉一下轉盤,然後重新生成。每個節點最近 12 次生成的紀錄,讓你在決定之前可以比較舊版和新版。再加一個風格節點管色調、一個參考節點管角色,你手上就有一條像真正劇組的流程了。
攝影機、風格、參考:完整的劇組
一部前後一致的片子靠三根支柱:攝影機節點管光學、風格節點管色調、參考節點靠一個 @提及 就守住同樣的臉。
攝影機節點負責光學,但一部前後一致的片子靠三根支柱。第二根是風格節點:一段寫下來的美術方向加上情緒板圖片,接到你的生成器上,就能把同樣的色調和質感套用到所有鏡頭。第三根是參考節點,它讓你的角色在每個鏡頭之間都認得出來。
參考節點值得兩句話的使用說明。你給它一個名字、一段描述和幾張照片;接下來,在任何提示詞裡打一個 @提及,顯示為綠色,就會自動注入描述並附上照片。少了它,你的女主角每次生成都換一張臉,而攝影機節點的任何轉盤都救不了。
所以一段戲的標準組裝只需要少少幾個節點:一個接到所有地方的攝影機、一個接到所有地方的風格、每個角色一個參考,然後每個鏡頭一個圖像節點或影片節點。如果接這些線讓你卻步,右下角的助理可以一鍵搭好完整工作流並加進畫布,每則訊息 1 點。
指揮救不了什麼,以及接下來
攝影機節點修不好手,也修不好物理,每三到四支影片仍有一支報廢:它主要消滅的,是構圖被動接受而非主動選擇所造成的失敗。
限制我們就講清楚。攝影機節點讓成像更可靠,但它不會修正模型本身的弱點:手依然是碰運氣,物理依然只是近似,而影片上每三到四次生成仍然有一次要丟進垃圾桶,設定再完美也一樣。已經交付但拍壞的鏡頭照樣計費,只有技術性失敗會自動退還點數。
攝影機的指揮主要減少的是失敗裡比較糟的那一半:那些源自構圖被動接受而非主動選擇的失敗。再搭配先用圖像確認每個鏡頭、再拿去動起來的方法,也就是我們談第一支 AI 影片的文章裡詳述的做法,它會把一筆抽獎預算變成一筆製作預算。
下一個具體步驟:打開一張畫布,放一個用 Flux Schnell 的 1 點圖像節點,放一個攝影機節點,然後用三種不同的構圖生成同一個場景。三點、十分鐘,你就會憑直覺明白這篇文章解釋的一切。如果你偏好先看再試,文件裡內建的影片課程學院會示範這個練習的實際操作。
