第一章の抜粋
これがデモです。一語一句書き写された冒頭、語り手の声、音の層、画面に表示される表紙。PDFと題名を差し替えれば、残りはそのままで、あなたの書籍用の動画が作り直されます。
キャンバスにドロップされたPDF版の一章:1つのTextノードがその冒頭を一語一句そのまま書き写し、ElevenLabsの語り手の声がそれを読み上げ、下でインストゥルメンタルの音の層が流れ、表紙は16:9のMontageの画面に留まり続けます。第一章を聴いてもらうために公開する動画です。ワークフロー全体がアカウントなしで見られます。
実際のワークフロー:PDFの小説の第一章をMediaノードに入力、Claude Sonnet 5が冒頭を書き写し、ElevenLabs v3がナレーションを担当、ElevenLabs Musicが音の層を作曲、GPT Image 2.5 Flareが表紙を描き、Montageノードで仕上げます。表示されているテキストは、手を加えていないモデルの出力そのままです。
概要
第一章を聴いてもらうことは、書籍にとって最良の宣伝になります。PDFはMediaノードに入り、Textノードがその「解析する画像またはPDF」ポートから読み込んで、何も書き直さずに冒頭を一語一句書き写し、1,400文字に達する前の段落の終わりまでを取り出します。これは1分半ほどの朗読に相当する長さです。
Voice-overノードは、ElevenLabs v3を使ってこの接続されたテキストを読み上げます。語り手の声はリストから選びます。Musicノードは、接続されたブリーフに基づいて60秒のインストゥルメンタルの音の層を作曲し、Montage内で低音量でループされます。ImageノードはGPT Image 2.5 Flareで題名入りの表紙を描き、Montageはナレーションの長さいっぱい、黒背景の上でその表紙全体を保持します。
デモでは、この例のために書かれたオリジナル小説「North of Silence」の冒頭が読まれます。PDFをご自身の章に、ノード内の声を、表紙プロンプト内の題名を差し替えてください。一章全体を読む場合は、3,000文字ごとの複数のVoice-overノードを使い、Montage内で端から端まで並べます。表紙と予告編がこのシリーズを完成させます。
これらは上記ワークフローの生成ファイルであり、モデルが出力したものをそのまま、加工なしで掲載しています。出発点がある場合はそれも表示しています。
レンダリング結果
スタジオも声優も使わずに第一章を聴いてもらいたい、あるいは完全なオーディオブックの前に声を試したい著者や出版者の方々。
スキャンではなく、テキスト形式のPDFの一章:Textノードが文章をそのまま書き写し、声が一文一文それを読み上げます。
章のPDFをドロップします
Mediaノードがこれを受け取ります。Textノードは要約ではなく冒頭をそのまま書き写します。読まれるのはあなた自身の文章であり、段落の終わりまで一文一文そのままです。
声を選んで読み上げます
Voice-overノードはケーブルでテキストを受け取ります。約20種類のElevenLabs v3の音色、またはクローンした声から選べます。デモでは落ち着いた語り手George を使用しています。テキスト内の[pause]や[whispers]タグが演技のガイドになります。
音の層を作曲し、表紙を描きます
Musicノードは接続されたブリーフから60秒のインストゥルメンタルを作曲します。Imageノードは3:4の表紙内に題名を書き入れ、2つのクレジットを添えます。両方ともナレーションに触れずに作り直せます。
編集して公開します
Montageは16:9で黒背景の上に表紙全体を配置し、ナレーションを1トラック、低音量でループする音の層を別トラックに置き、最後にフェードをかけます。ブラウザ内でレンダリングされ、クレジット表記なしで、mp4として書き出されます。
同じキャンバスを、別の用途に合わせて調整。各バリエーションは、プロンプトを2〜3行変えるだけです。
これがデモです。一語一句書き写された冒頭、語り手の声、音の層、画面に表示される表紙。PDFと題名を差し替えれば、残りはそのままで、あなたの書籍用の動画が作り直されます。
3,000文字ごとにTextノードを1つ、それぞれにVoice-overノードを1つ配置し、すべてを同一のMontage内に置きます。15分の章は約10個のノードで読み上げられ、その下に音の層がループします。
1分ほどの録音からVoice-overノード内で自分の声をクローンし、ナレーション用に選びます。スタジオなしで、第一章があなた自身の声で読まれます。
ImageノードとMontageを外します。ナレーションと音の層はノードから直接mp3として書き出され、ポッドキャストプラットフォームや書籍のページに使えます。
Textノードに該当部分の翻訳を依頼し、Voice-overノードの言語を設定し、表紙はそのままにします。同じ動画が英語、スペイン語、ドイツ語で、同じ声のまま存在します。
指示は文章を正確に書き写すことです。モデルが要約してしまう場合、テキストを含まないスキャンされたPDFを読み込んでいることが原因です。ページ画像ではなく、テキスト形式のPDFに原稿を変換してください。
音楽はMontage内で0.25に設定され、ナレーションの下に留まるようにしてあります。強いメロディーを持つ音の層は耳を引いてしまうため、ブリーフには主題なし、パーカッションなしの背景を依頼してください。
Montageは黒背景上に画像全体を収めるよう設定されています。カバーモードにすると、3:4の表紙は上下の題名部分が失われてしまいます。抜粋動画には「収める」設定を保ってください。
はい、分割してです。1つのVoice-overノードは最大3,000文字まで読めます。Textノードに次の部分を依頼し、Voice-overノードを複製して、Montage内で各部分を端から端まで並べてください。料金は読み上げた文字数に応じて変わります。
デモの場合、合計で60クレジットほどです。1,400文字のナレーション(12クレジットほど)、60秒の音の層(50クレジットほど)、表紙(2クレジット)、PDFの読み込み(2〜3クレジット)です。料金はクリックする前に各ノードに表示されます。
はい。ElevenLabs v3はカンマ、句点、そして空行で区切られた段落を認識します。より長い休止には[pause]タグを、囁きには[whispers]タグを使ってください。タグ自体は読み上げられません。
1分半から2分、つまり1,400文字から1,800文字ほどです。声と場面を提示するには十分な長さで、スマートフォンで最後まで聴きやすい短さです。
はい、テキストを再生成せずにVoice-overノード上で変更できます。別の音色を選んでもう一度読み上げを実行すれば、Montageも更新されます。
いいえ、Montageには任意の画像クリップで十分です。著者の写真、舞台となる場所のイラストなどでも構いません。ただし題名入りの表紙は、依然として最もシェアされやすいものです。
書籍のページ、SNS、ポッドキャストの第0話として:mp4は16:9、1080pで、音声もミックスされた状態で書き出されます。9:16のMontageを使えば縦型版も作れます。