2026年9月24日
用 AI 打造有聲劇集:從構想到混音完成的完整流程(2026 指南)
設定集、具備記憶的寫作、配音、音效、氛圍音、音樂與混音:用 AI 製作有聲劇(audio drama)的完整方法,並以一集實際試播集算出真實成本。

Frank HoubreImaginode 創辦人
為什麼大家都投入有聲劇集
以短集數、每集留下懸念收尾的有聲劇集,已經成為一種大眾格式,而 AI 剛剛讓一個人也能獨力製作它。
人們在通勤時、做菜時、跑步時聽這些內容:切成幾分鐘一集的虛構故事,由多個聲音演繹,搭配營造氛圍的音效與音樂。像 Pocket FM 這類應用程式聲稱光是這個格式就擁有超過 2.5 億名聽眾,聽眾群早已遠遠超出播客愛好者的範圍。
在此之前,製作一部劇集需要一整個團隊:一名編劇負責整季內容,每個角色都需要配音演員,還要有錄音室、負責音效、音樂與混音的音效工程師。這意味著數週的工作量,以及讓大多數創作者卻步的預算。
到了 2026 年,這條製作鏈上的每一個環節都有了 AI 對應方案:能撰寫並記住整季劇情的語言模型、能演出對白的合成語音、音效與音樂生成器。本指南將逐步示範如何把這些工具組合起來,並附上在 Imaginode 的 Drama Studio 中製作出的一集試播集的真實數字。
有聲劇集的五大要素
一部有聲劇集立基於五大要素:設定集、腳本、配音、聲音與混音。少了其中一項,聽眾馬上就會察覺。
設定集是整部劇集的參考文件:角色是誰、他們想要什麼、他們說話的方式、故事發生在哪裡、開展了哪些情節線,又如何收尾。沒有設定集,第4集就可能會與第2集互相矛盾。
腳本就是各集本身,以「適合聽的方式」撰寫:台詞、少數旁白介入,以及音效與音樂的提示。配音負責演繹這些台詞,一個角色配一種聲音,讓聽眾在不同集數之間都能認出來。
聲音由三層構成:單次出現的音效(一扇門、一支電話)、每個場景的持續氛圍音(一座車站、夜晚的森林),以及音樂。最後,混音把這一切放上時間軸,在配音出現時壓低音樂,並調整音量,讓一集聽起來的音量與任何播客一致。
步驟一:把一個構想變成劇集設定集
只要兩句話的構想就足以生成一份完整的設定集,前提是您要指定類型、每集時長與整季集數。
以我們試播集所使用的構想為例:「巴黎到尼斯末班夜車的一名列車長,發現有位乘客每週都帶著一張1987年的車票搭車。她決定跟蹤他。」類型為驚悚,每集3分鐘,一季6集。
從這裡開始,Drama Studio 的設定集代理人在45秒內生成了片名(《Le Train de Minuit》,午夜列車)、劇情梗概、六個角色(包含一位旁白)、五個地點及其為聲音引擎描述的音景、六條待展開的情節線、一段音樂主題,以及六集的劇情大綱,每集都以一個轉折點結尾。實測成本:6 點數。
這個步驟中最重要的部分是選角。每個角色都會依性別、年齡與音色獲得專屬配音,這個聲音會跟隨他整整一季。請仔細重讀角色描述:其中也說明了每個角色說話的方式,而這正是讓對白栩栩如生的關鍵。
步驟二:以整季記憶撰寫每一集
劇集真正的挑戰不在於寫出一集好故事,而在於寫第七集時,不遺忘前六集發生過的事。
如果只是簡單要求語言模型「寫第5集」,它會憑空捏造內容。要撐起一整季,AI 編劇需要拿到設定集、整季大綱,以及一份記憶:每一集已完成劇情的摘要、每個角色學到了什麼,以及每條情節線目前的狀態。這正是 Drama Studio 所做的事:每寫完一集,系統就會記錄下記憶,下一集便從那裡接續開始。
在試播集中,3分鐘長的第1集只花了40秒寫成:60句台詞、3次場景轉換、4個音效、2個音樂提示點,約3,000個口白字元。實測成本:7 點數。舉例來說,記憶中記下了列車長掃描了1987年的車票,而系統接受了這張票,這個事實在第2集中不可能再被忽略。
接下來是審稿階段。第二位代理人「劇評」會為開場吸引力、節奏、連貫性、對白與結尾各項打出滿分10分的評分,並指出有問題的台詞。在試播集中,它抓出了兩個真正的連貫性錯誤,其中包括兩名列車長在沒有電話的情況下,從兩節不同車廂互相對話。成本:2至3點數。它的意見只需一鍵就能套用重寫,而舊版本仍可還原取回。關於寫作規則本身,請參閱我們的文章如何寫出吸引人的有聲劇。
步驟三:讓配音演出
一個場景是一次演繹完成的:該場景的所有台詞會一起送進語音引擎,由它像真實對話一樣把角色串聯起來。
這正是「朗讀」與「戲劇」之間的差別所在。如果每句台詞分開生成再拼接在一起,聽起來就會有規律的停頓,語氣也彼此對不上。工作室所使用的 ElevenLabs 對話引擎,一次最多可接收一個場景中十句台詞,並附上每個角色的聲音,輸出成一段語氣自然銜接、反應流暢的完整段落。
每句台詞都可以附上演出方式:低語、笑、嘆氣、好奇、悲傷或興奮。這些標籤確實會改變演繹方式,劇評也會標出用錯情境的部分,例如在一個悲劇性揭露的時刻卻標了「笑」。
配音支援十四種語言,同一部劇集可以用您觀眾的語言撰寫並製作。若只需要單一旁白或雙人播客,畫布上的AI 旁白與雙人語音播客工具就已足夠;若是多角色的虛構故事,工作室才能在各集之間維持選角的一致性。
步驟四:音效、氛圍音與音樂
聲音和配音一樣能說故事,前提是用量要少:每個地點一段氛圍音、只有在推動劇情時才用音效,整部劇集共用一段音樂主題。
氛圍音是投資報酬率最高的一層:每個地點只需一段20秒的循環音(夜晚的月台、行駛中列車的車廂內部),就足以讓聽眾進入場景,並在該地點的每個場景下持續播放。在試播集中,兩段氛圍音就涵蓋了整集內容。
音效需要拿捏分寸。若沒有下達數量限制的指示,AI 在兩分鐘內放了十一個音效,而每一個都打斷了對白。工作室現在把音效上限設在約每四十秒一個,只保留給能推動劇情的聲音:一扇門甩上、一張票遞出、一聲出發的哨音。若需要單獨的音效,畫布上的音效生成器也能單獨使用。
音樂主題只需製作一次(純樂器版本),並在所有集數中重複使用:它在每集開場響起,在配音出現時退到背景,並在結尾以一小段戲劇性強音收尾。這是第一集中花費最高的項目(試播集中花了84點數),也是唯一不會重複支付的部分。
步驟五:混音與發布
混音會把每個聲音安排到時間軸上,在配音出現時壓低音樂,並將音量標準化至約 -16 LUFS,這是播客業界的標準值。
在 Drama Studio 中,混音直接在您的瀏覽器裡完成,不另外收費:對白區塊會依照實際長度前後銜接,音效疊加其上且不會讓下一句台詞延遲超過1.5秒,每段氛圍音會在其對應場景下循環播放,音樂也會在角色開口說話時自動降低音量。
混音完成的試播集全長4分鐘,音量測得為 -16.2 LUFS,真實峰值為 -1.7 dBFS,以 .m4a 格式儲存不到4 MB。在工作室裡收聽時,正在播放的台詞會在腳本中亮起,讓您能在一秒內找到需要修改的句子。
檔案完全屬於您:您可以下載它,並發布到播客平台、附上靜態圖片上傳到 YouTube,或放到您自己的網站。它同時也會存進您的 Imaginode 媒體庫,之後還能作為畫布上剪輯影片的配樂使用。
一集實際要花多少錢
以3分鐘的試播集來說,寫作花了15點數,製作花了151點數,其中84點數是隻需支付一次的音樂主題費用。
2026年9月23日實測的明細如下:整季設定集6點數、單集寫作7點數、審稿2至3點數。在製作方面,包含13段對白、4個音效、2段氛圍音、1個戲劇性強音與音樂主題,總計21個聲音元素,花費151點數。混音本身則完全免費。
從第二集開始,已使用過的音樂主題與地點氛圍音都可以重複利用:一集3分鐘的內容,聲音部分成本大約落在60到70點數,再加上約10點數的寫作費用。若只需要配音,大約每分鐘對白花費12點數。
而且已經製作完成的聲音絕不會重複收費:如果您修改某句台詞,只有包含該句台詞的段落會重新生成。這正是為什麼即使到了製作後期,重寫仍然負擔得起。
讓聽眾中途放棄的常見錯誤
旁白太多、角色聲音太相似、音效滿天飛、一集結尾沒有懸念:這四個錯誤都應在製作前就先修正。
什麼都靠旁白交代,會把虛構故事變成有聲書:請把旁白保留給時間與場景的轉換,讓角色自己撐起劇情推進。兩個聲音太相似的角色容易讓聽眾混淆:在設定集中,請賦予他們不同的年齡、音色或口音。
音效太多會讓耳朵疲勞,也會打斷節奏:一段選得恰到好處的氛圍音,勝過十個音效。最後,一集若沒有留下開放性問題就結束,聽眾就沒有理由接著聽下一集:劇評給出的「結尾」分數,是您最該優先留意的指標。
最簡單的入門方式,就是完整聽完一集從頭到尾製作出來的劇集。《Le Train de Minuit》試播集可在Drama Studio 頁面線上收聽,如果您正在多款工具之間猶豫不決,我們的與 Pocket FM 的 Sherpa 比較文章詳細說明了每款工具實際能做到什麼。