替生成的鏡頭配音
最直接的用法:所有從影像節點跑出來、沒有聲音的影片,也就是大多數。把當初生成畫面用的描述拿回來,留下音源、丟掉情緒,環境音的指令就已經寫好四分之三了。
一個無聲鏡頭、一層環境音、一床音樂:三塊素材在這裡生成,剪輯把它們合起來。不用註冊帳號就能看到完整流程。
真實工作流,真實成果。可自由拖曳與縮放。
使用這個工作流真實流程:雨中露天座的鏡頭是無聲的,兩個節點做出它缺掉的環境音和音樂。
重點摘要
大多數生成出來的影片都是無聲的,而最先出賣它們的,正是那份安靜。這個流程做出缺掉的兩條軌:環境音用 ElevenLabs Sound Effects,音樂床用 ElevenLabs Music。
媒體節點沒有接到任何東西,這不是漏接。目錄裡沒有任何模型能把影片當成輸入、再推導出它的音效:聲音是用文字描述出來的。所以鏡頭留在你眼前,是為了讓你一邊看一邊寫那兩段指令,它就是為此而存在。
分成兩個節點而不是一個,是因為環境音和音樂的對法不同:前者要對齊鏡頭長度,後者要生成得更長、在剪輯時裁掉。合成在剪輯裡完成,那是畫布工具列上的工具,會匯出成一個檔案。整套跑完一美元出頭。
匯入你的無聲鏡頭
生成的影片、手機素材、螢幕錄影:媒體節點照單全收。記下它的長度,決定環境音要多長的就是它。
寫出應該聽到什麼
不是情緒,是音源。雨打在帆布上、水滴進水窪、輪胎輾過濕路面。音效是用清單的方式描述的,不是用意圖。
音樂另外寫
樂器、速度、不要鼓、不要人聲。還要寫明它必須替音效留出空間:一段把整個頻譜填滿的音樂,會把你剛做好的環境音壓死。
在剪輯裡合起來
影片、環境音、音樂放在三條軌上,音量調好,輸出一個檔案。鏡頭不再無聲,就是在這一步。
同一塊畫布,針對不同需求微調:每個變化版本只要改兩三行提示詞。
最直接的用法:所有從影像節點跑出來、沒有聲音的影片,也就是大多數。把當初生成畫面用的描述拿回來,留下音源、丟掉情緒,環境音的指令就已經寫好四分之三了。
在頁面頂端循環播放的鏡頭,只放環境音、不放音樂會更好。音效可以對齊循環的精確長度,接縫就聽不出來,而剪過的音樂永遠做不到這件事。
手機素材會一起帶回麥克風裡的風聲和隔壁鄰居的講話。生成一段乾淨的環境音、在剪輯時換掉,比重拍便宜,也比一個無聲鏡頭不容易被發現。
音樂節點可以單獨使用,不必跑完整個流程:為多個鏡頭的剪輯鋪三十秒的器樂床。生成得比需要的更長,裁切留給剪輯,淡出永遠勝過戛然而止。
一扇門、一個放下的杯子、一步踩在碎石上。ElevenLabs Sound Effects 做得又短又準,這類單點聲音在剪輯裡可以對到影格。一個聲音一段指令,絕對不要寫成清單。
沒有規定一定要從影片開始。一串靜態圖片剪成的簡報,配音方式一模一樣,而輪播之所以看起來像真的一段序列,通常就是因為這個。
「憂鬱而沉重的環境音」對音效引擎來說毫無意義。雨打在帆布上、水在滴、輪胎輾過濕路面,這才是它做得出來的。情緒是結果,不是指令。
這個錯誤帶來最讓人失望的結果。模型把兩種語彙混在一起,吐出一個四不像,雨聲聽起來像沙鈴。兩個節點、兩段指令、剪輯裡兩條可調的音量。
放任的音樂模型很樂意加上歌聲,而影片底下有歌聲,之後就再也放不進旁白。就算看起來理所當然,也要在指令裡寫上不要人聲。
環境音對的是鏡頭,不是整支片。五秒鏡頭配二十秒雨聲,只能隨便找地方裁;照正確長度生成的那一層,放上去根本不用想。
因為目前還沒有模型會「聽」畫面。音效和音樂是從文字生成的,不是從影片。鏡頭放在那裡,是讓你一邊寫一邊看,之後再帶著兩條軌一起進剪輯。
需要,而且這是這個範本最有用的地方。用一段指令同時要雨聲和鋼琴,得到的是一團糊,音效聽起來像樂器。分開之後,各自對各自的長度和音量。
用這兩個負責音效和音樂的節點不行。人聲有自己的節點,紀錄片影片這個流程示範了它怎麼接到一段文字上。
十秒環境音加三十秒音樂,一美元出頭。價格在點擊前就顯示在每個節點上,而且取決於你要的長度。
會,影片和音軌混成一支 MP4,在瀏覽器裡編碼。那是畫布工具列上的剪輯工具,它會直接取用專案裡的成品,不必你一個一個下載。
可以,成品是你的。要留意的是你怎麼要:指令裡點名某位藝人或某首既有曲子,那是在追求模仿,地就從那裡開始滑了。
音效二十二秒,音樂好幾分鐘。要更長的環境音,與其要一段超長的,不如生成一段可以循環的,在剪輯裡重複。
有些影片模型會自己產出配樂,剛好對味時很方便。這裡你握著主導權:兩條獨立的軌可以調、可以換,就算環境音不合意,鏡頭本身照樣能用。