ツール一覧へ

AIナレーション:同じ文章を三つのエンジンで読む

同じ原稿を ElevenLabs v3、MiniMax Speech 2.8 HD、OpenAI TTS HD の三つの音声合成エンジンが読み上げ、ナレーションを耳で選べます。アカウント登録なしで、ワークフロー全体をそのまま見られます。

インタラクティブデモ

本物のワークフロー、本物の結果。自由に移動・ズームできます。

このワークフローを使う

実際のワークフロー:テキストノードが原稿を持ち、三つのナレーションノードがそれぞれのエンジンで読み、あなたが聴きます。

概要

ワークフローの成果物
ナレーション3本
キャンバスの構成
5個のノードを3本の接続でつないだ構成
使用モデル
ElevenLabs v3, MiniMax Speech 2.8 HD, OpenAI TTS HD
1回のフル実行のコスト
約17クレジット($0.20)

動画のナレーション、チュートリアルの読み上げ、ポッドキャストの語り。問いはいつも「声を生成できるか」ではなく「どの声か」です。このワークフローは耳で答えます。原稿はテキストノードにあり、ケーブルで三つのナレーションノードに届き、それぞれが別のエンジンです。一文を変えて再実行すれば、三つとも読み直します。

三つの顔ぶれは偶然ではありません。ElevenLabs v3 はもっとも表情豊かで、読点と句点を演じ、もっとも高価です。MiniMax Speech 2.8 HD はもっとも自然で、固有名詞にわずかな訛りが出ることがあります。OpenAI TTS HD はノードの既定エンジンで、安定していて価格は半分です。各ノードには独自の声と速度があり、ElevenLabs には演技タグもあります。

デモの原稿は十五秒ほどで、読点、列挙、難しい単語を含み、それぞれのプロソディを聴くのに十分です。三つの読み上げで20セント。ノードはサイトの十四言語で文章を読みます。

手順

  1. 1

    テキストノードに原稿を書く

    丁寧な句読点が仕事の半分をします。エンジンは読点で息をつぎ、句点で声を落とします。読み方を正確にしたい数字は文字で書いてください。

  2. 2

    三つの読み上げを実行する

    「すべて生成」で三つのノードが一度に動きます。各ノードはクリック前に、文章の長さから計算した価格を表示します。

  3. 3

    同じ箇所を聴く

    いちばん難しい文、固有名詞や列挙のある文で比べてください。エンジンの差が出るのはそこで、最初の文ではありません。

  4. 4

    エンジンではなく声を変える

    各エンジンには複数の声があり、合わない声一つでエンジンを見限る必要はありません。切り替える前に、同じノードで二つ三つ試してください。

バリエーションと活用例

同じキャンバスを、別の用途に合わせて調整。各バリエーションは、プロンプトを2〜3行変えるだけです。

YouTube 動画のナレーション

十分の動画の原稿を一気に読む。MiniMax は耳を疲れさせずに長さを持ちこたえ、ElevenLabs はより生き生きしますが十分では高くつきます。顔出しなしの YouTube 動画のワークフローが映像で続きを引き受けます。

二十秒の広告

一語一語が重い二十秒。ElevenLabs v3 の得意分野で、文章の中に笑い、息、ささやきといった演技タグを受け付けます。シネマティック広告のワークフローが映像に載せた声を見せます。

学習用の読み上げ

授業、記事、歩きながら聴く一章。既定のエンジンで十分で、費用も最小です。一時間聴くなら、安定は美点です。

複数の言語で同じ声

日本語、スペイン語、フランス語のチュートリアルを同じ声で。ElevenLabs と MiniMax は言語をまたいでも声質を保ちます。ノードは文章の言語を読むので、原稿を訳すだけです。

二人の声の対話

掛け合う二人の登場人物。ナレーションノードには ElevenLabs の対話モードがあり、セリフごとに声を割り当てます。しゃべるアバターのワークフローはさらに先へ、話す顔つきです。

留守番電話や案内の声

挨拶メッセージ、店内アナウンス、美術館の音声ガイド。短い文章を何百回も読みます。一回あたりの価格が決め手で、既定のエンジンが勝ちます。

よくある失敗

最初の文で判断する

どのエンジンも簡単な文はうまく読みます。差が出るのは固有名詞、数字、列挙、長い文です。だからデモの原稿にはそれぞれ一つずつ入っています。

耳ではなく目のために書く

読むために書かれた文章は、声に出すとうまくいきません。長すぎる文、括弧、略語。エンジンに渡す前に自分で口に出し、文を二つに切ってください。

数字を数字のままにする

「2024年に1,500円」はエンジンによって三通りに読まれます。「二千二十四年に千五百円」と書けば、三つとも同じに読みます。

声を変える前にエンジンを変える

各エンジンには多くの声があります。低すぎる、速すぎる声はエンジンのせいではなく設定です。結論を出す前に二つの声と速度を試してください。

おすすめモデル

よくある質問

三つのどれを選べばいいですか。

演じる文章、広告、フィクション、意図が必要なものすべてには ElevenLabs v3。自然で長い語り、ドキュメンタリーやチュートリアルには MiniMax。量をこなすなら OpenAI。安定した読み上げを何十本も、低価格で。

自分の声を使えますか。

このワークフローでは使えません。エンジンの声を比べるものだからです。ナレーションノードは一部のエンジンで参照音声を受け付けますが、それは別のページであり、同意という別の問いでもあります。

どの言語で使えますか。

ElevenLabs と MiniMax はサイトの十四言語すべて、日本語、アラビア語、ヘブライ語を含みます。OpenAI もその大半を読めますが、英語以外では訛りが強めです。ノードは文章の言語を選びます。

ナレーションの費用はいくらですか。

デモの原稿二百三十文字で、ElevenLabs は7クレジット、MiniMax は7、OpenAI は3、三つ合わせて17です。価格は文章の長さに従い、クリック前に各ノードに表示されます。

文章の最大長はどれくらいですか。

ノードあたり数千文字で、正確な上限はエンジンによりノードに表示されます。長い文章は段落ごとに分け、段落につき一ノードにすると、直した段落だけを再実行できます。

感情や速度は調整できますか。

速度は三つとも。感情は MiniMax ではノードの設定で、ElevenLabs v3 では文章の中に角括弧で書くタグで。OpenAI は書かれた通りに読みます。

スマートフォンからできますか。

できます。キャンバスはモバイルで動き、文章はノードに直接書けます。スマートフォンで作るガイドに指で操作するキャンバスの動きをまとめてあります。

ファイルは自由に使えますか。

はい。生成した声はあなたのもので、公開動画にも商用にも使えます。エンジンの声はライセンスされた合成音声で、実在の人物ではありません。

AIナレーション:同じ文章を三つのエンジンで読む

このワークフローを使う

無料アカウント、クレジットカード不要。ワークフローは入力済みの状態でキャンバスに開きます。