ツール一覧へ

AIで二人の声のポッドキャストを作る

二人の司会者による8つのセリフのやり取りを、ElevenLabs Dialogue v3 が1テイクで演じます。二つの声、掛け合い、笑い。ワークフロー全体を登録なしで、エピソードとともに見られます。

インタラクティブデモ

本物のワークフロー、本物の結果。自由に移動・ズームできます。

このワークフローを使う

実際のワークフロー:ダイアログモードのナレーションノード一つ、8つのセリフ、セリフごとに一つの声、ElevenLabs Dialogue v3。エピソードを聴いてください。

概要

ワークフローの成果物
ナレーション1本
キャンバスの構成
2個のノードを0本の接続でつないだ構成
使用モデル
ElevenLabs Dialogue v3
1回のフル実行のコスト
約7クレジット($0.08)

二人の声のポッドキャストは、ナレーションを二つ順に貼り合わせても作れません。セリフの間の沈黙は不自然に、つなぎは整いすぎ、誰も正しい瞬間に笑いません。ElevenLabs Dialogue v3 はすべてのセリフをまとめて受け取り、同じ部屋にいる二人のようにやり取りを1テイクで演じます。デモは1分、テーマは単純な疑問です。なぜ歳をとると時間が早く過ぎるのか。

すべてはダイアログモードのナレーションノード一つに収まります。各セリフにはモデルの21の声から選んだ声があります。デモは女性と男性を一つずつ選びました。似た二つの声はモノローグに聞こえるからです。角括弧のタグ、[laughs]、[curious]、[whispers] は読み上げられずに演技を導きます。デモの5番目のセリフは [laughs] で始まり、それが聞こえます。

1ノードにつき最大10セリフ、3000文字。長いエピソードは複数のノードをつなぎ、編集ノードで組み立てます。モデルは文字数で課金されます。話す1分あたり十数クレジットを見ておいてください。ポッドキャスト1時間で12ドル以下です。

手順

  1. 1

    やり取りをセリフごとに書く

    話すように短い文で。一つの考えに一つのセリフ。答えさせ、押し返させ、遮らせる。ポッドキャストを作るのは往復であって、長い語りではありません。

  2. 2

    各セリフに声を与える

    女性一つ、男性一つ、声質の離れたもの。同じ司会者には最初から最後まで同じ声。ノードにリストがあるので、選ぶ前に二つ聴いてください。

  3. 3

    演技タグを置く

    楽しんでいるセリフの前に [laughs]、質問の前に [curious]、譲歩の前に [sighs]。1セリフに最大1タグ、残りはモデルがやります。

  4. 4

    生成し、聴き、1セリフを直す

    ノードはやり取り全体を演じます。あるセリフが変なら、テキストかタグを変えて再実行。モデルは全体を演じ直し、端から端まで一貫します。

バリエーションと活用例

同じキャンバスを、別の用途に合わせて調整。各バリエーションは、プロンプトを2〜3行変えるだけです。

スタジオなしの企業ポッドキャスト

エピソードごとに台本一つ、固定の二つの声、ノードごとに1分。編集がノードを組み立て、ジングルと音楽を足します。マイクも部屋も失敗テイクもなし。

記事を会話に要約する

一方の声に質問させ、もう一方に答えさせる。ブログ記事が歩きながら聴ける5分のやり取りになります。キャンバスのテキストモデルが台本を書けます。

研修や授業の対話

先生と生徒、顧客と相談員、患者と医師。二つの声とためらいのタグで、ケースが生き生きします。シナリオごとに一つのノード。

オーディオドラマの一場面

二人の登場人物、感情タグ、[whispers]、[sad]、[excited]、そして場面の下に生成した効果音。編集ノードが声を環境音の上に置きます。

二人の声の音声広告

30秒、質問一つと答え一つ、最後のセリフにブランド。女性と男性の声が役を分け、編集が音楽を足します。

エピソードを作り、整えて公開する

ファイルはきれいに出てきます。レベルをならす必要があれば改善ノードが引き受けます。MP3はノードからダウンロードでき、ポッドキャスト配信の準備ができています。

よくある失敗

似た二つの声

同年代の女性の声二つ、あるいは低い男性の声二つでは、誰が話しているかわからなくなります。デモのように声質ごとに一つ選び、エピソードをまたいで保ってください。

セリフではなく演説

200語のセリフはもうやり取りではなく講義です。切って、もう一方の声に引き取らせる。ポッドキャストのリズムは往復から生まれます。

タグが多すぎる

1セリフに1タグは演技を導き、4つは戯画にします。毎行の [laughs] は結局嘘っぽく聞こえます。デモは8セリフに2つです。

10セリフを超える

ノードは10セリフと3000文字を受け付けます。モデルがやり取りの一貫性を保つためです。それ以上は複数のノードに分け、編集で組み立てます。

おすすめモデル

よくある質問

二つの声は本当に応答し合いますか。

はい。モデルはセリフをまとめて受け取り、掛け合い、息継ぎ、やり取りのテンポを扱います。編集でつないだ二つのナレーションとの違いはそこです。

自分の声を使えますか。

ここでは使えません。モデルには21の声があり、クローンはしません。自分に似た声でテキストを読ませるには、声を変えるワークフローがあなたの録音を別の声質で演じ直します。

どの言語で?

セリフの言語で、サイトの14言語に対応します。言語はノードで設定します。デモは日本語で、発音できる声を使っています。

1エピソードいくらですか。

料金は文字数で計算され、クリック前にノードに表示されます。話す1分あたり十数クレジット、デモのやり取りは1000文字で14クレジットです。ポッドキャスト1時間で12ドル以下です。

声は何種類ありますか。

21種類、女性と男性、すべてサイトの14言語を話せます。対話は二つ以上を混ぜられますが、ポッドキャストには二つで足ります。

1ノードの最大長は?

3000文字、約3分の会話です。20分のエピソードなら編集ノードにつないだ7つのノードで、それぞれ単独で再実行できます。

音楽やジングルを足せますか。

足せます。同じキャンバスで、テーマ曲用の音楽ノードと、その上に声を置く編集ノード。動画に音をつけるワークフローが原理を示しています。

スマートフォンからできますか。

できます。キャンバスはモバイルで動き、セリフはノードに入力し、エピソードはその中で再生します。スマートフォンで作るガイドに操作をまとめてあります。

AIで二人の声のポッドキャストを作る

このワークフローを使う

無料アカウント、クレジットカード不要。ワークフローは入力済みの状態でキャンバスに開きます。