2026年8月12日
AI 角色一致性:讓同一張臉貫穿每一張圖與每一段影片
為什麼你的角色每次生成都換一張臉、為什麼四百字的提示詞也救不了,以及 Imaginode 的參考節點如何用三張照片加一個 @提及 解決問題。
每個人用不到十分鐘就會撞上的問題
一字不改的提示詞,每次生成都給你不同的角色:這是模型的正常運作方式,解方在參考圖,不在更好的文字。
你為專案生成了一位女主角。她很完美:三十歲、一頭紅色短髮、洗白的丹寧外套。你再跑一次生成,想看看她的側臉。結果傻眼。頭髮變成栗色、外套不見了、五官完全換了一個人。同一段提示詞,一字不差,角色卻不同。
這不是 Imaginode 的 bug,也不是任何其他工具的 bug。這是目前所有圖像模型的正常運作方式。在搞懂原因之前,你會浪費好幾個小時、燒掉數十點數,一次次重跑,期待奇蹟出現。這篇文章先講清楚原因,再給你真正的解方:那種在漫畫、系列貼文或短片的實際製作裡真的行得通的方法。
先誠實劇透:解方不是更好的提示詞,而是把角色拿給模型看,而不是描述給它聽,也就是使用參考圖。在 Imaginode 上,這件事由參考節點負責。我們會一步步把它搭起來,從主肖像到綠色的 @提及,每一步都附上確切的點數價格。
臉為什麼會變:隨機雜訊
每次生成都從不同的隨機雜訊出發,模型對先前的圖像毫無記憶:你的提示詞描述的是一類人,它每次都從中挑一個新的。
圖像模型不像插畫家那樣把角色記在腦子裡。每一次生成都從一張隨機雜訊圖開始,那是一團隨機抽出的像素泥,模型再依照你的提示詞逐步去除雜訊。兩次不同的雜訊抽樣就是兩個不同的起點,終點自然是兩張不同的臉。
你的提示詞只描述了一類人:「三十歲紅髮女性,穿丹寧外套」對應到數百萬張可能的臉。模型每次都從中挑一張符合描述的,而且從不會挑到同一張,因為沒有任何東西要求它這麼做。
還得再加上第二個壞消息:模型沒有記憶。第 12 次生成完全不知道前面 11 次發生過什麼。它並沒有記得你的女主角,它根本沒認識過她。每一次點下生成都是從零開始,換一團新的雜訊,沒有任何共同的過去。
為什麼再詳細的提示詞都不夠
語言太貧乏,抓不住一張臉上成千上萬的微小比例:四百字能穩住頭髮和外套,穩不住五官,而且每多一個字,就從別處偷走一分注意力。
第一個反應大家都一樣:寫得更細。四百字描述鼻型、眼距、垂在左邊的那撮瀏海。這確實會讓容易的部分穩定一點,例如髮色或服裝。但那張臉,還是繼續在變。
原因令人洩氣但很合理:語言太貧乏,描述不了一張臉。你試著用文字描述你最好的朋友,再把這段文字交給一位從沒見過他的畫師。畫出來的肖像會很合理,但絕對不像。人臉是成千上萬個微小比例的組合,沒有任何詞彙能夠捕捉。
而且提示詞越長,模型就要在越多互相打架的指令之間取捨。超過某個長度之後,你在臉上多寫的每一個字,都要用場景、光線或動作上失去的注意力來付帳。你最後拿到的是一張僵硬的肖像,而不是你想要的那張有生命的圖。
真正的解方:用看的,不要用說的
把參考圖一起交給生成:三張好照片幾乎每次都能給你一個認得出來的角色,而長篇提示詞五次裡才出現一次勉強像的替身。
現實裡的畫師會怎麼做?他會跟你要一張照片。新一代的模型也能做一模一樣的事:你在生成時附上一張或多張參考圖,模型就直接把它們當成視覺來源,而不是去詮釋文字。
差別非常明顯。四百字的提示詞五次裡大概只有一次給你一個勉強像的替身;三張好的參考照片,幾乎每次都能給你一個認得出來的角色。這不是魔法:模型是在複製真實的比例,而不是憑空發明。
不過要注意,並不是所有模型都支援。在 Imaginode 上,當你選的模型不支援參考圖時,節點上根本不會出現參考連接埠。看不到那個連接埠,就換一個模型,不用去找什麼隱藏設定:沒有這種東西。
參考節點,一步一步來
參考節點把名字、描述和照片收在一起,建立一次,專案裡的每個圖像節點或影片節點都能重複使用,而且自動儲存。
在 Imaginode 的畫布上新增一個參考節點。它有三個欄位。首先是名字:「小雅」、「迷霧船長」,你想叫什麼都可以,盡量短。接著是描述:這段文字會被注入你的提示詞裡,後面會再細談。最後是照片:把角色最好的幾張圖拖進去。
這個節點在整個專案裡都能重複使用。你只建立一次,畫布上的每個圖像節點或影片節點都能接上去。這正是節點式畫布的整套邏輯:角色變成放在某處的一塊積木,而不是要複製貼上到二十段提示詞裡的一個段落。
一個每天都很有感的實用細節:系統自動儲存,而且每個節點都會保留最近 12 次生成的紀錄。如果第 7 版的角色才是對的,它還在那裡,隨時可以加進參考節點。
綠色的 @提及,或者說怎麼召喚你的角色
在任何提示詞裡打 @ 加上名字:描述會自動注入,照片會自動當成參考送出,而魔法棒改寫時也會保留這個提及。
參考節點建好之後,你在任何提示詞裡打 @ 再加上它的名字,就能召喚這個角色。提及會在文字中顯示為綠色,代表它確實連到了節點。這時候你的提示詞可以寫得又短又自然:「@小雅 在雨中穿過夜市,遠景」。
生成時,Imaginode 會自動做兩件事:把節點的描述注入提示詞,並把照片當成參考圖一起送出,前提是你使用支援編輯的模型。你不必複製任何東西,也不必重新上傳。一個提及就夠了。
還有一個很值得一提的附加好處:魔法棒會透過 Kimi 把你的圖像與影片提示詞改寫成豐富的英文,一次 1 點,而且會保留 @提及。所以你可以放心把提示詞寫得更豐富,不會弄斷通往角色的連結。在一次生成要 6 點的情況下,就是這種細節讓你少踩坑。
哪些圖像模型撐得住同一個角色
5 點的 Seedream 5 Lite 是參考圖之王,2 點的 GPT Image Mini 用來反覆試,6 點的 Flux Kontext 換場景又不動到角色。
在圖像這一邊,Imaginode 上的參考圖之王叫做 Seedream 5 Lite,一次生成 5 點,約 0.05 歐元。任何會重複出現的角色都建議預設選它:它接受你的圖片,還原臉孔的忠實度在這個價位上沒有對手。
另外兩個選擇看需求。GPT Image Mini 只要 2 點,同樣支援參考圖:拿來反覆試姿勢和構圖,又不會把點數表跑光。而 6 點的 Flux Kontext 扮演的是另一種角色:它編輯既有的圖片。「把背景換成海灘」,你的角色原封不動,場景卻換掉了。
反過來說,1 點的 Flux Schnell 或 3 點的 Imagen 4 Fast 都是很優秀的通才,但別指望它們維持系列主角的臉部一致性。正確的做法是:先用便宜的模型打構圖草稿,再切到 Seedream 5 Lite 配上 @提及 來產出最終圖。
主肖像工作法
先做一張角色單人、中性背景、光線明確的肖像:抓 4 到 5 次嘗試,也就是 24 到 30 點,換來之後所有圖的基石。
典型錯誤:拿角色已經在情境裡的圖當參考,人在畫面裡很小、逆光、背對鏡頭。這樣模型學到的背景跟臉一樣多。正確做法是先做一張主肖像:角色單人、中性背景、光線明確。
具體來說,開一個圖像節點,選一個寫實模型例如 6 點的 Imagen 4,而且只描述角色:「半身肖像,30 歲女性,紅色短髮,洗白的丹寧外套,純灰背景,正面柔光」。一直重跑,直到跑出那一張臉為止。抓 4 到 5 次嘗試,也就是 24 到 30 點,不到 0.30 歐元。
這張肖像會成為參考節點的基石,後面所有的圖都由它衍生。這是十分鐘的投資,替你省下後面好幾個小時的抽獎,而且這是整個流程裡唯一真的值得大量重跑的階段。
讓參考照片的角度有變化
四張圖通常就夠:正面、四分之三側面、側面和全身;4 張無可挑剔的照片勝過 8 張普通的,因為一張失敗的參考會汙染之後所有生成。
只有一張正面肖像是個好開始,但模型只從一個角度認識你的角色。你叫它畫側面,它就會即興發明一個鼻子、一副下顎、一對耳朵。想在三維空間裡鎖死一個角色,就得讓它看到好幾個視角。
實測好用的組合是:一張正面肖像、一張四分之三側面、一張側面,再加一張全身來交代身形和穿著。四張圖通常就夠了。要生出這些圖,就從主肖像出發,用支援參考圖的模型,然後要求「同一個人,側面視角,同樣的灰色背景」。每一張結果都要先檢查過,才加進節點。
這一步請比任何地方都更嚴格。一張稍微失敗的參考照片,下巴有點不一樣、耳朵畫得馬虎,會悄悄汙染之後所有的生成,而你會跑去錯的地方找原因,也就是你的提示詞裡。4 張無可挑剔的圖勝過 8 張普通的圖。用 Seedream 5 Lite 一個視角 5 點,重做一張有疑慮的照片只要 0.05 歐元。不要跟自己討價還價。
把描述寫成一份連戲合約
描述裡只寫必須貫穿所有鏡頭的東西,疤痕、外套、手錶:身分住在節點裡,場景住在提示詞裡。
參考節點的描述欄位不是裝飾用的:只要提示詞裡出現 @提及,這段文字就會被注入。所以裡面只能寫那些必須貫穿所有鏡頭的東西,其他一律不寫。也就是那些長期不變的辨識特徵:左邊眉毛上的疤、洗白的丹寧外套、右手腕的錶、微駝的走路姿勢。
不要把場景之間會變的東西寫進去。如果你在描述裡寫「面帶微笑,在咖啡館裡」,那你的角色連在暴風雨場景中間都會在咖啡館裡笑。描述負責身分,提示詞負責場景。這種分工才讓整套系統站得住。
在片場,這件工作有個名字:連戲紀錄。沒有人覺得它光鮮,但每個人都承認,就是靠它,演員才不會在兩個鏡頭之間換了一件襯衫。你的參考節點扮演的正是這個角色。
影片這一邊:各模型與它們的確切上限
Seedance 2.0 和 MiniMax H3 接受 9 張參考圖,Grok 接受 5 張,Kling V3 和 Veo 3.1 Fast 各 3 張;最可靠的技巧仍然是把一張完美的圖接成影片的起始圖。
影片面對的是跟圖像一樣的問題,而且更嚴重:一張臉在幾秒之內慢慢跑掉,一眼就看得出來。好消息是,Imaginode 上有多個影片模型支援參考圖,只是上限各不相同。Seedance 2.0 和 2.0 Fast 各收 9 張,Seedance 2.5 還更多。MiniMax H3 同樣是 9 張,Grok Imagine Video 是 5 張,Kling V3 和 Veo 3.1 Fast 各 3 張。
影片節點也會依模型給出不同的輸入:一張起始圖,以及模型支援時的一張結束圖。說到底,最可靠的技巧還是這一招:先用 Seedream 5 Lite 生成一張完美的角色圖,再把它接成影片的起始圖。動作就從一張已經正確的臉開始。
成功率我們就老實說:AI 影片大約每三到四次生成就會失敗一次,有沒有參考圖都一樣。一隻手穿過物體、視線飄到別處。請把這些損耗算進預算。Kling 2.5 Turbo 5 秒要 26 點,Seedance 2.0 Fast 的 720p 要 48 點,一個真正可用的鏡頭實際上要花兩倍的標價。至於技術性失敗,系統會自動退還點數。
實例:六格迷你漫畫
主肖像、補充視角,再加上含重跑在內的六個格子:一整套角色穩定的迷你漫畫約需 105 點,也就是 1.05 歐元。
來看一個實際的例子:給 Instagram 用的六格迷你漫畫,主角是養蜂人露娜。第一步,中性背景上的主肖像:用 Imagen 4 試 5 次,30 點。第二步,補充視角,四分之三側面、側面、全身:用 Seedream 5 Lite 大約 6 次生成,30 點。「@露娜」這個參考節點就完成了。
第三步,六個格子。每段提示詞都很短:「@露娜 在日出時打開蜂箱,俯角視角」。用 5 點的 Seedream 5 Lite,並且算上每兩格重跑一次,六個格子大約要 45 點。整個專案合計大約 105 點,也就是 1.05 歐元。一組六張、角色又穩定的視覺,很難做得比這更划算。
同一個節點下週還能用在第二集,接著用在露娜對鏡頭揮手的 5 秒影片上。一個角色,只定義一次,到處延伸。同樣的原理,也讓一位虛擬 UGC 創作者能在十五秒的對鏡頭影片裡撐住。這就是節點邏輯相對於那些每張圖都從白紙重來的工具,真正的價值所在。
陷阱一:互相矛盾的參考圖
來自角色不同版本的照片會產生一個模糊的平均值:如果生成結果每次都差一點對卻從不一樣,該清的是節點,不是提示詞。
最常見的陷阱:在參考節點裡混進角色不同版本的照片。兩張圖的髮型略有出入,第三張的外套顏色更深。模型被要求忠於彼此矛盾的來源,就會生出一個誰都不像的模糊平均值。
症狀很好認:每次生成都差一點就對,但彼此之間從來不一致。遇到這種情況,別去動提示詞。打開參考節點,把照片並排看,毫不留情地刪掉那些不一致的。回到主肖像,把它當成唯一的事實來源。
一條簡單的規則:每一張加進去的照片,都必須能用跟其他照片一模一樣的一句話來描述。如果你得說「這張是她還沒有那道疤之前的」,它就不該待在這個節點裡。你應該替角色的那個版本另外建一個參考節點。
陷阱二:八張幾乎一樣的照片
太多相同的範例會鎖死姿勢而不是臉:四張有變化的照片,永遠贏過八張同一張正面肖像的複製品。
反方向的陷阱也存在。八張正面肖像,同樣的表情、同樣的光線、同樣的背景。模型會推論這一切都是角色的特徵:角度、僵住的笑容、打光。結果就是,你要求別的東西時它會抵抗。你的角色在每一個場景裡都正面看著鏡頭,連全力衝刺時也是。
這是參考圖版本的過度擬合:太多相同的範例,鎖死的是姿勢,不是臉。破解方式跟角度那一節的建議一致:圖少一點,但要有變化。四張涵蓋正面、四分之三側面、側面和全身的照片,永遠贏過八張同一張肖像的複製品。
在 Seedance 2.0 或 MiniMax H3 這類最多可放 9 張參考圖的影片模型上,把每個位置都塞滿的誘惑很大。忍住。只有當每一張圖都帶來新資訊時才放進去:一個角度、一套服裝、一種表情。否則三張好圖勝過九張重複的圖。
今天就從這裡開始
三十分鐘的一次操作就夠:主肖像、參考節點、第一個用 @提及 的場景,全部加起來不到 Starter 方案 900 點的 15%。
行動計畫三十分鐘就能跑完。開一個圖像節點,在中性背景上生成你的主肖像,抓三十點左右的試錯預算。建立參考節點,替角色取名,寫三句長期不變的描述,加入主肖像以及補充視角。接著用 @提及 搭配 Seedream 5 Lite 測試第一個場景。
如果你不想自己接線,Imaginode 的助理可以一鍵搭好完整工作流,每則訊息 1 點:描述「一系列有固定角色的貼文」,它就會把圖像、參考和影片節點放好並連接完成。你只要放上照片、調整提示詞就行。
使用每月 900 點的 Starter 方案,未稅 13 歐元,這一整次操作用掉的還不到方案的 15%。而且全部在瀏覽器裡完成,生成跑在伺服器端:不用安裝、不用擁有顯示卡,中午在客廳筆電上的一段空檔就夠了。
角色穩定之後,下一個工程是把他好好地放進畫面:構圖、鏡頭、運鏡。這正是攝影機節點的主題,我們也為它寫了一整篇文章,「如何指揮 AI 的攝影機」。你的女主角現在有一張站得住的臉了,接下來就是給她真正的鏡頭。
