ブログ

2026年9月24日

AIでオーディオドラマシリーズを作る:アイデアからミックス済みエピソードまで(2026年版ガイド)

バイブル、記憶を持たせた脚本執筆、声、効果音、環境音、音楽、そしてミックス。実際のパイロットエピソードでコストを算出しながら、AIでオーディオドラマを制作する方法を完全解説します。

Frank Houbre

Frank HoubreImaginode創業者

なぜ誰もがオーディオドラマシリーズに乗り出しているのか

数分の短いエピソードに区切り、続きが気になる引きで終わるオーディオシリーズは、今やマスフォーマットになりました。そしてAIは、それを一人で制作できるものに変えたのです。

通勤中に、料理をしながら、走りながら。数分単位のエピソードに区切られ、複数の声で演じられ、効果音と音楽が雰囲気を作り出すフィクション、それがオーディオドラマです。Pocket FMのようなアプリは、このフォーマットだけで2億5000万人以上のリスナーを抱えると謳っており、その層はポッドキャストファンをはるかに超えて広がっています。

これまでシリーズを制作するにはチームが必要でした。シーズンを書く作家、各キャラクターを演じる声優、録音するスタジオ、効果音・音楽・ミックスを担う音響エンジニア。何週間もの作業と、多くの作家をためらわせる予算が必要だったのです。

2026年、この工程のあらゆる部分にAIの代替手段が存在します。シーズン全体を書き、記憶するAI言語モデル、対話を演じられる合成音声、効果音・音楽の生成ツール。本ガイドでは、Imaginodeのドラマスタジオで制作したパイロットエピソードの実際の数値とともに、それらを組み合わせる手順を段階的に紹介します。

オーディオシリーズを支える5つの要素

オーディオシリーズは、バイブル、脚本、声、音、ミックスという5つの要素の上に成り立っています。どれか一つでも省くと、聴いた瞬間に違和感を覚えます。

バイブルとは、シリーズの基準となる文書です。登場人物は誰か、何を望んでいるか、どんな話し方をするか、物語の舞台はどこか、どんな伏線を張り、どう回収するか。バイブルがなければ、エピソード4はエピソード2と矛盾してしまいます。

脚本はエピソードそのものであり、耳で聴くために書かれます。台詞、ナレーターによるいくつかの語り、効果音と音楽の指示です。声はこれらの台詞を演じ、キャラクターごとに一つの声が割り当てられ、エピソードをまたいでも聞き分けられます。

音は3つの層で構成されます。単発の効果音(ドア、電話)、各場所の連続的な環境音(駅、夜の森)、そして音楽です。最後にミックスがこれらすべてをタイムライン上に配置し、声の下で音楽を絞り、どんなポッドキャストとも同じ音量で聴けるようレベルを調整します。

ステップ1:アイデアをシリーズのバイブルに変える

ジャンル、エピソードの長さ、シーズンの話数さえ決めれば、たった2文のアイデアから完全なバイブルが手に入ります。

パイロットに使ったアイデアを見てみましょう。「パリ発ニース行き最終夜行列車の車掌が、ある乗客が毎週1987年付きの切符で乗車していることに気づく。彼女は彼を尾行することにする」。ジャンルはスリラー、エピソードは3分、シーズンは6話構成です。

ここから、ドラマスタジオのバイブルエージェントは45秒で、タイトル(「Le Train de Minuit」)、ログライン、ナレーターを含む6人のキャラクター、サウンドエンジン用に記述された環境音付きの5つの場所、追うべき6つの伏線、音楽テーマ、そしてそれぞれがどんでん返しで終わる6話分のプランを作成しました。計測されたコストは6クレジットです。

この段階で最も重要なのはキャスティングです。各キャラクターには、性別、年齢、声質に応じて専用の声が割り当てられ、その声はシーズンを通してそのキャラクターに付き従います。キャラクターの説明文をよく読んでください。それぞれの話し方も記されており、それこそが台詞に生命を吹き込む鍵になります。

ステップ2:シーズンの記憶を持たせて各エピソードを執筆する

シリーズにとって本当の難関は、良いエピソードを一本書くことではなく、最初の6話で起きたことを忘れずに7話目を書くことです。

単に「エピソード5を書いて」と頼んだだけの言語モデルは、話を作り上げてしまいます。シーズンを一貫させるには、AIライターにバイブル、シーズンプラン、そして記憶、つまりすでに書かれた各エピソードの要約、各キャラクターが学んだこと、各伏線の状態を与える必要があります。まさにこれがドラマスタジオの仕組みです。エピソードを書くたびにその記憶を保存し、次のエピソードはそこから始まります。

パイロットでは、3分のエピソード1が40秒で執筆されました。60の台詞、3回のシーン転換、4つの効果音、2つの音楽キュー、約3,000文字分の台詞です。計測されたコストは7クレジット。記憶には、例えば車掌が1987年の切符をスキャンし、システムがそれを受理したという事実が記録されており、エピソード2はもうこれを無視できなくなります。

続いて行われるのが推敲です。2つ目のエージェントである批評エージェントが、つかみ、テンポ、整合性、台詞、結末を10点満点で評価し、問題のある台詞を指摘します。パイロットでは、実際に2つの矛盾が見つかりました。そのうち一つは、電話もないのに2人の車掌が別々の車両から会話しているというものです。コストは2から3クレジット。その指摘はワンクリックで書き直しに反映でき、旧バージョンも復元可能です。執筆のルールそのものについては、惹きつけるオーディオドラマの書き方の記事をご覧ください。

ステップ3:声に演じさせる

シーンは一気に演じられます。すべての台詞がまとめて音声エンジンに送られ、実際の会話のようにキャラクターをつなげていきます。

朗読とドラマの違いはここにあります。もし台詞を一つずつ別々に生成してつなぎ合わせれば、不自然な間や噛み合わないイントネーションが耳につきます。スタジオが使用するElevenLabsの対話エンジンは、シーンの台詞を最大10個、各キャラクターの声とともに受け取り、反応が自然につながる一つながりの音声を返します。

各台詞には演技の指示を持たせることができます。ささやく、笑う、ため息をつく、興味を示す、悲しむ、興奮する、といった具合です。こうしたタグは実際に演技を大きく変え、批評エージェントは、悲劇的な展開の場面で笑いが入っているような、場面に反する演技を指摘してくれます。

声は14の言語で演じられ、同じシリーズを、視聴者の言語で執筆・制作することができます。単独のナレーションや二人で話すポッドキャストには、キャンバスのAIナレーション二人語りポッドキャストツールで十分です。複数キャラクターのフィクションでは、エピソードをまたいでキャスティングを一貫させるスタジオが力を発揮します。

ステップ4:効果音、環境音、音楽

音は声と同じくらい物語を語ります。ただし使いすぎないことが条件です。場所ごとに1つの環境音、物語を動かす時だけ効果音を1つ、シリーズ全体で音楽テーマは1つ。

環境音は最もコストパフォーマンスに優れた層です。場所ごとに20秒のループ(夜の駅のホーム、走行中の列車の車内など)があれば、リスナーをその場所に置くには十分で、その場所を舞台にするシーンではずっと流れ続けます。パイロットでは、2つの環境音でエピソード全体をカバーしています。

効果音は加減が必要です。数の指定なしでは、AIは2分間で11個も効果音を配置し、そのたびに対話が途切れてしまいました。現在スタジオでは、およそ40秒に1つを上限とし、物語を前に進める音、ドアが閉まる音、切符を差し出す音、出発の笛の音などに限定しています。単発の音が必要な場合は、キャンバスの効果音ジェネレーターを単独で使うこともできます。

音楽テーマは一度だけインストゥルメンタルで作曲され、すべてのエピソードで使い回されます。エピソードの冒頭で流れ、声の下で控えめになり、結末では短いドラマチックなスティングが余韻を強調します。これがパイロットの最初のエピソードで最も費用がかかった部分(84クレジット)であり、二度と繰り返し発生しない唯一のコストです。

ステップ5:ミックスして公開する

ミックスはすべての音をタイムライン上に配置し、声の下で音楽を絞り、ポッドキャストの基準である-16 LUFS前後にラウドネスを正規化します。

ドラマスタジオでは、ミックスはブラウザ内で無料で行われます。対話のブロックは実際の長さのままつながり、効果音はその上に重なりますが、次の台詞を1.5秒以上遅らせることはありません。各環境音はそのシーンの下でループし、キャラクターが話し始めると音楽は自動的に下がります。

ミックス済みのパイロットは4分間、ラウドネスは-16.2 LUFS、トゥルーピークは-1.7 dBFS、.m4a形式で4MB未満のサイズです。スタジオ内で再生している間は、脚本の中で再生中の台詞がハイライトされるため、修正すべき文をすぐに見つけられます。

ファイルはあなたのものです。ダウンロードして、ポッドキャストプラットフォームに公開したり、静止画付きでYouTubeにアップロードしたり、自分のサイトに掲載したりできます。またImaginodeのメディアにも保存され、キャンバスで編集する動画のサウンドトラックとしても使えます。

エピソード1本の実際のコストはいくらか

3分のパイロットでは、執筆に15クレジット、制作に151クレジットかかりました。そのうち84クレジットは、一度払えばよい音楽テーマ分です。

2026年9月23日に計測した内訳です。シーズンのバイブル6クレジット、エピソードの執筆7クレジット、推敲2から3クレジット。制作段階では、13の対話パッセージ、4つの効果音、2つの環境音、1つのドラマチックなスティング、そして音楽テーマ、合計21の音で151クレジットです。ミックスにはコストがかかりませんでした。

2話目以降は、テーマ曲やすでに登場した場所の環境音を再利用できます。そのため3分のエピソードは、音の面でおよそ60から70クレジット程度に収まり、これに執筆の約10クレジットが加わります。声だけの場合は、対話1分あたり約12クレジットが目安です。

そして、一度作った音は二度と支払う必要がありません。台詞を修正しても、その部分を含むパッセージだけが再生成されます。これにより、制作の終盤であっても書き直しを手頃なコストで行えるのです。

リスナーが離脱してしまう失敗

ナレーターに頼りすぎる、キャラクターの声が似通っている、効果音を入れすぎる、引きのないまま終わるエピソード。これらは制作前に直すべき4つの失敗です。

何もかも説明してしまうナレーターは、フィクションをオーディオブックに変えてしまいます。ナレーターは時間や場所の転換のために取っておき、行動はキャラクター自身に語らせましょう。声が似すぎている2人のキャラクターは混同されてしまいます。バイブルの段階で、年齢、声質、訛りなどを変えて差別化してください。

効果音を入れすぎると耳が疲れ、テンポが崩れます。うまく選んだ環境音一つが、効果音10個分の役割を果たします。そして、開かれたままの疑問を残さずに終わるエピソードは、次を聴く理由を与えません。批評エージェントが付ける「結末」のスコアこそ、最初に注視すべき項目です。

始めるのに一番わかりやすいのは、最初から最後まで制作されたエピソードを実際に聴いてみることです。「Le Train de Minuit」のエピソードはドラマスタジオのページで聴くことができます。複数のツールで迷っている方には、Pocket FMのSherpaとの比較で、それぞれが実際に何をしてくれるのかを詳しく解説していますのでご覧ください。

実際のキャンバスで試してみませんか?

この記事で紹介した内容は、すべてブラウザ上のImaginodeで実践できます。

始める