AIで書籍の音声抜粋を作成する

キャンバスにドロップされたPDF版の一章:1つのTextノードがその冒頭を一語一句そのまま書き写し、ElevenLabsの語り手の声がそれを読み上げ、下でインストゥルメンタルの音の層が流れ、表紙は16:9のMontageの画面に留まり続けます。第一章を聴いてもらうために公開する動画です。ワークフロー全体がアカウントなしで見られます。

オリジナル小説の第一章、MediaノードにドロップされたPDFインタラクティブデモ

本物のワークフロー、本物の結果。自由に移動・ズームできます。

このワークフローを使う

実際のワークフロー:PDFの小説の第一章をMediaノードに入力、Claude Sonnet 5が冒頭を書き写し、ElevenLabs v3がナレーションを担当、ElevenLabs Musicが音の層を作曲、GPT Image 2.5 Flareが表紙を描き、Montageノードで仕上げます。表示されているテキストは、手を加えていないモデルの出力そのままです。

概要

ご用意いただくもの
PDF1件 · テキストまたはブリーフ
ワークフローの成果物
画像1枚(3:4) · 音声トラック1本、合計60秒 · ナレーション1本
キャンバスの構成
8個のノードを6本の接続でつないだ構成
使用モデル
Claude Sonnet 5, ElevenLabs v3, ElevenLabs Music, GPT Image 2.5 Flare
1回のフル実行のコスト
約97クレジット($1.16)
アカウント
デモはアカウントなしでご覧いただけます。生成には無料アカウントが必要です(試用クレジット付き)

第一章を聴いてもらうことは、書籍にとって最良の宣伝になります。PDFはMediaノードに入り、Textノードがその「解析する画像またはPDF」ポートから読み込んで、何も書き直さずに冒頭を一語一句書き写し、1,400文字に達する前の段落の終わりまでを取り出します。これは1分半ほどの朗読に相当する長さです。

Voice-overノードは、ElevenLabs v3を使ってこの接続されたテキストを読み上げます。語り手の声はリストから選びます。Musicノードは、接続されたブリーフに基づいて60秒のインストゥルメンタルの音の層を作曲し、Montage内で低音量でループされます。ImageノードはGPT Image 2.5 Flareで題名入りの表紙を描き、Montageはナレーションの長さいっぱい、黒背景の上でその表紙全体を保持します。

デモでは、この例のために書かれたオリジナル小説「North of Silence」の冒頭が読まれます。PDFをご自身の章に、ノード内の声を、表紙プロンプト内の題名を差し替えてください。一章全体を読む場合は、3,000文字ごとの複数のVoice-overノードを使い、Montage内で端から端まで並べます。表紙予告編がこのシリーズを完成させます。

デモの実際のレンダリング結果

これらは上記ワークフローの生成ファイルであり、モデルが出力したものをそのまま、加工なしで掲載しています。出発点がある場合はそれも表示しています。

レンダリング結果

章の冒頭のナレーション、ElevenLabs v3の声George による読み上げElevenLabs v3で生成
ElevenLabs Musicが作曲した60秒のインストゥルメンタルな音の層、声の下でループ再生ElevenLabs Musicで生成
GPT Image 2.5 Flareが描いた題名入りの表紙、Montage内で全体表示GPT Image 2.5 Flareで生成
編集済みの抜粋:画面に表紙、ナレーションと音の層、公開準備完了

対象となる方

スタジオも声優も使わずに第一章を聴いてもらいたい、あるいは完全なオーディオブックの前に声を試したい著者や出版者の方々。

ご用意いただくファイル

スキャンではなく、テキスト形式のPDFの一章:Textノードが文章をそのまま書き写し、声が一文一文それを読み上げます。

手順

  1. 1

    章のPDFをドロップします

    Mediaノードがこれを受け取ります。Textノードは要約ではなく冒頭をそのまま書き写します。読まれるのはあなた自身の文章であり、段落の終わりまで一文一文そのままです。

  2. 2

    声を選んで読み上げます

    Voice-overノードはケーブルでテキストを受け取ります。約20種類のElevenLabs v3の音色、またはクローンした声から選べます。デモでは落ち着いた語り手George を使用しています。テキスト内の[pause]や[whispers]タグが演技のガイドになります。

  3. 3

    音の層を作曲し、表紙を描きます

    Musicノードは接続されたブリーフから60秒のインストゥルメンタルを作曲します。Imageノードは3:4の表紙内に題名を書き入れ、2つのクレジットを添えます。両方ともナレーションに触れずに作り直せます。

  4. 4

    編集して公開します

    Montageは16:9で黒背景の上に表紙全体を配置し、ナレーションを1トラック、低音量でループする音の層を別トラックに置き、最後にフェードをかけます。ブラウザ内でレンダリングされ、クレジット表記なしで、mp4として書き出されます。

バリエーションと活用例

同じキャンバスを、別の用途に合わせて調整。各バリエーションは、プロンプトを2〜3行変えるだけです。

第一章の抜粋

これがデモです。一語一句書き写された冒頭、語り手の声、音の層、画面に表示される表紙。PDFと題名を差し替えれば、残りはそのままで、あなたの書籍用の動画が作り直されます。

複数回に分けた章全体

3,000文字ごとにTextノードを1つ、それぞれにVoice-overノードを1つ配置し、すべてを同一のMontage内に置きます。15分の章は約10個のノードで読み上げられ、その下に音の層がループします。

著者本人が読み上げる抜粋

1分ほどの録音からVoice-overノード内で自分の声をクローンし、ナレーション用に選びます。スタジオなしで、第一章があなた自身の声で読まれます。

画像なしのポッドキャスト版

ImageノードとMontageを外します。ナレーションと音の層はノードから直接mp3として書き出され、ポッドキャストプラットフォームや書籍のページに使えます。

複数言語版の抜粋

Textノードに該当部分の翻訳を依頼し、Voice-overノードの言語を設定し、表紙はそのままにします。同じ動画が英語、スペイン語、ドイツ語で、同じ声のまま存在します。

よくある失敗

テキストの代わりに要約になっている

指示は文章を正確に書き写すことです。モデルが要約してしまう場合、テキストを含まないスキャンされたPDFを読み込んでいることが原因です。ページ画像ではなく、テキスト形式のPDFに原稿を変換してください。

声を覆ってしまう音の層

音楽はMontage内で0.25に設定され、ナレーションの下に留まるようにしてあります。強いメロディーを持つ音の層は耳を引いてしまうため、ブリーフには主題なし、パーカッションなしの背景を依頼してください。

切り取られてしまう表紙

Montageは黒背景上に画像全体を収めるよう設定されています。カバーモードにすると、3:4の表紙は上下の題名部分が失われてしまいます。抜粋動画には「収める」設定を保ってください。

おすすめモデル

よくある質問

一章全体を読むことはできますか?

はい、分割してです。1つのVoice-overノードは最大3,000文字まで読めます。Textノードに次の部分を依頼し、Voice-overノードを複製して、Montage内で各部分を端から端まで並べてください。料金は読み上げた文字数に応じて変わります。

抜粋にはいくらかかりますか?

デモの場合、合計で60クレジットほどです。1,400文字のナレーション(12クレジットほど)、60秒の音の層(50クレジットほど)、表紙(2クレジット)、PDFの読み込み(2〜3クレジット)です。料金はクリックする前に各ノードに表示されます。

声は句読点を尊重しますか?

はい。ElevenLabs v3はカンマ、句点、そして空行で区切られた段落を認識します。より長い休止には[pause]タグを、囁きには[whispers]タグを使ってください。タグ自体は読み上げられません。

抜粋はどのくらいの長さが適切ですか?

1分半から2分、つまり1,400文字から1,800文字ほどです。声と場面を提示するには十分な長さで、スマートフォンで最後まで聴きやすい短さです。

後から声を変更できますか?

はい、テキストを再生成せずにVoice-overノード上で変更できます。別の音色を選んでもう一度読み上げを実行すれば、Montageも更新されます。

表紙は必要ですか?

いいえ、Montageには任意の画像クリップで十分です。著者の写真、舞台となる場所のイラストなどでも構いません。ただし題名入りの表紙は、依然として最もシェアされやすいものです。

動画はどこに公開すればよいですか?

書籍のページ、SNS、ポッドキャストの第0話として:mp4は16:9、1080pで、音声もミックスされた状態で書き出されます。9:16のMontageを使えば縦型版も作れます。

AIで書籍の音声抜粋を作成する

このワークフローを使う

無料アカウント、クレジットカード不要。ワークフローは入力済みの状態でキャンバスに開きます。