Nodaro ドキュメント
ドキュメントノードリファレンスモデルAI エージェント(MCP)開発者向けセルフホスティングリサーチ
オーディオ

テキストから音声

ElevenLabs v3、Turbo v2.5、Multilingual v2 で、テキストを自然な音声にします。ボイスを選び、オーディオタグで感情を加え、最大 46 の言語で読み上げます。

テキストから音声(Text to Speech)ノードは、ElevenLabs の音声モデルを使って、テキストを読み上げ音声に変換します。テキストを書くか接続し、ボイスとモデルを選びます。ノードが返すオーディオファイルは、動画に重ねたり、顔にリップシンクさせたり、音楽とミックスしたりできます。デフォルトのモデルである ElevenLabs v3 は 46 の言語を話し、[laughs] や [whispers] などのオーディオタグにも対応しています。

使いどころ

  • 動画、解説動画、広告のボイスオーバーやナレーションが必要なとき。
  • キャラクターにセリフを話させたいとき。たとえば、リップシンク(Lip Sync)でポートレートを動かす前の音声です。
  • 書いた台本から、ポッドキャスト風の音声を作りたいとき。
  • 同じ台本を、複数の言語で読み上げたいとき。
  • 感情、リアクション、間をテキストに直接書き込んで、表現豊かに読み上げたいとき。

複数のボイスによる会話を 1 つのファイルにする場合は、代わりにテキストから会話(Text to Dialogue)を使います。

クイックスタート

ノードを追加する

キャンバス上で Tab を押し、オーディオ › 音声とナレーション › テキストから音声を選びます。

テキストを渡す

テキスト(Text)、プロンプト(Prompt)、脚本生成(Generate Script)のいずれかのノードを、プロンプト入力に接続します。代わりにノードにテキストを直接入力する場合は、設定パネルを開き、テキストのソースを直接入力にします。

ボイスとモデルを選ぶ

ボイスでボイスブラウザーを開き、いくつかプレビューを聞いて 1 つ選びます。モデルは、もっと長いテキストや安い料金が必要でなければ、ElevenLabs v3 のままにします。

実行する

ノードの実行をクリックします。音声がプレーヤー付きでノードに表示されます。それまでの結果も、すべてノードの結果一覧に残ります。

プロンプトオーディオオーディオ動画テキスト台本テキストから音声ElevenLabs v3オーディオ FX部屋(屋内)動画生成動画とオーディオを結合
台本がナレーション音声になり、部屋のリバーブで声をシーンになじませてから、その声を動画に結合します。

入力

入力接続できるノード説明
プロンプトテキスト、プロンプト、脚本生成、テキストを結合(Combine Text)などのテキスト系ノードテキストのソースが接続されたノードからのときに、読み上げるテキストです。

出力のオーディオは、読み上げた音声の URL です。いくつのノードにでも同時に渡せます。

設定

設定説明
テキストのソース接続されたノードから(デフォルト)は、プロンプトに接続されたテキストを読み上げます。直接入力は、テキストに入力したテキストを読み上げます。
テキストテキストのソースが直接入力のときに、読み上げるテキストです。[ か / を入力すると、オーディオタグを挿入できます。{Script} のように、ほかのノードのラベルを波かっこで囲んで書くと、そのノードの値を入れられます。
モデルElevenLabs v3(デフォルト)、ElevenLabs Turbo v2.5、ElevenLabs Multilingual v2 のいずれかです。
ボイス読み上げるボイスです。ボイスブラウザーが開きます。デフォルトは Rachel です。
言語自動検出(デフォルト)か、モデルの一覧にある言語の 1 つです。
安定性0〜1 です。値が低いほど表情豊かで変化に富み、高いほど均一に聞こえます。
類似度0〜1 です。結果がボイスの声質にどれだけ近いかを決めます。Turbo v2.5 と Multilingual v2 のみです。
スタイルの誇張0〜1 です。元のボイスのスタイルを強めます。Turbo v2.5 と Multilingual v2 のみです。
速度0.7x〜1.2x です。Turbo v2.5 と Multilingual v2 のみです。
前後のテキスト読み上げるテキストの前後に必ず追加されるテキストです。ワークフローをアプリとして使う人には表示されません。プロンプトの前後のテキストを参照してください。

ボイスの設定は、プレビューの設定に従います。スライダーを動かさなければ、ノードはボイスに保存されている設定を使います。これは、そのボイスのプレビューを作ったときと同じ設定です。そのため、結果は聞いたプレビューと同じように聞こえます。スライダーを動かすと、変わるのはその値だけで、ボイスのほかの保存済みの設定はそのまま使われます。

テキストから音声の設定パネル。「テキストのソース」「モデル」「ボイス」「言語」と、「安定性」のスライダーがあります。テキストから音声の設定パネル。「テキストのソース」「モデル」「ボイス」「言語」と、「安定性」のスライダーがあります。

モデル

テキストから音声では、以下の 3 つの ElevenLabs 音声モデルを実行できます。モデルをクリックすると、クレジットの料金を確認できます。

モデル開発元モードクレジット詳細
ElevenLabs v3ElevenLabsテキストから音声30テキストから音声を生成する最新の ElevenLabs のモデルで、感情や話すテンポを指定する [audio tags] に対応しています。ElevenLabs の API を直接使います。
ElevenLabs Turbo v2.5ElevenLabsテキストから音声15ElevenLabs の API を直接使って、高速かつ安価にテキストから音声を生成します。ナレーションに向いています。
ElevenLabs Multilingual v2ElevenLabsテキストから音声30ElevenLabs の API を直接使って、多言語でテキストから音声を生成します。
モデル言語オーディオタグ1 回の実行あたりの文字数
ElevenLabs v3(デフォルト)46対応5,000
ElevenLabs Turbo v2.532非対応。読み上げる前に取り除かれます40,000
ElevenLabs Multilingual v229非対応。読み上げる前に取り除かれます10,000

どのモデルを選ぶか

  • ElevenLabs v3:デフォルトです。表現豊かな音声、オーディオタグ、最も幅広い言語対応が必要なときに選びます。
  • ElevenLabs Turbo v2.5:より安く、より高速です。シンプルなナレーションや、1 回の実行で最大 40,000 文字の長いテキストに選びます。
  • ElevenLabs Multilingual v2:29 の言語で自然に読み上げます。1 回の実行で最大 10,000 文字です。

Nodaro のすべてのオーディオモデルについては、モデルの選び方を読んでください。

ボイスを選ぶ

ボイスブラウザーには、3 つのタブがあります。

  • 標準ボイス:ElevenLabs の標準のボイスです。
  • マイボイス:すでに持っているカスタムボイスです。説明から新しいボイスを作るには、ボイスデザイン(Voice Design)を使います。
  • ボイスライブラリ:ElevenLabs の共有ライブラリです。検索と、アクセント、年齢、言語、用途、トーンのフィルターを使えます。

どのボイスにも、選ぶ前に再生できるプレビューがあります。

ボイスライブラリの各ボイスは、作成者が特定のモデル向けに検証しています。ノードが Turbo v2.5 か Multilingual v2 で動いていて、そのモデル向けに検証されていないライブラリのボイスを選んだとします。するとノードは、モデルを、そのボイスが検証されているモデルに切り替えます。ElevenLabs v3 はどのボイスでも生成できるので、v3 のノードが切り替えられることはありません。

オーディオタグで感情を加える

ElevenLabs v3 は、オーディオタグを読み取ります。オーディオタグは角かっこで囲んだ短い指示で、テキストの中の、効果を入れたい位置に置きます。たとえば I can't believe it [laughs] that's amazing です。

種類例
感情[excited]、[sad]、[angry]
リアクション[laughs]、[sighs]、[gasps]
話し方[whispers]、[shouting]
間の取り方[pause]、[long pause]
トーン[cheerfully]、[deadpan]
効果音[applause]、[thunder]

v2 のモデルは、読み上げる前にオーディオタグを取り除くため、残ったテキストが不自然に読まれることがあります。v2 のモデルで間を入れるには、代わりに <break time="1.0s" /> のような break タグを使います。

違いを聞く

以下の 2 つのテイクは、どちらも ElevenLabs v3 と標準ボイスの Rachel を使っています。1 つ目は 2 つのオーディオタグ付きでテキストを読み上げ、2 つ目はタグなしで同じ言葉を読み上げています。

オーディオタグ付きのテキスト
I looked everywhere for it. [whispers] And then I found it, right under the old map. [laughs] It was there the whole time.
[whispers] と [laughs] の 2 つのタグを入れた場合。
タグを入れずに、同じ言葉を読み上げた場合。

言語

ほとんどのテキストは、自動検出で問題なく読み上げられます。英語以外のテキストでは、言語を明示的に選ぶと、発音がよくなることがあります。

  • Multilingual v2(29 言語):英語、日本語、中国語、ドイツ語、ヒンディー語、フランス語、韓国語、ポルトガル語、イタリア語、スペイン語、インドネシア語、オランダ語、トルコ語、フィリピン語、ポーランド語、スウェーデン語、ブルガリア語、ルーマニア語、アラビア語、チェコ語、ギリシャ語、フィンランド語、クロアチア語、マレー語、スロバキア語、デンマーク語、タミル語、ウクライナ語、ロシア語。
  • Turbo v2.5(32 言語):Multilingual v2 のすべての言語に加えて、ハンガリー語、ノルウェー語、ベトナム語。
  • v3(46 言語):Turbo v2.5 のすべての言語に加えて、ヘブライ語、タイ語、ベンガル語、ウルドゥー語、ペルシア語、セルビア語、リトアニア語、ラトビア語、エストニア語、ジョージア語、アイスランド語、カタルーニャ語、アフリカーンス語、スワヒリ語。

クレジット

料金はモデルによって異なり、最も安いのは ElevenLabs Turbo v2.5 です。各モデルの料金はモデルの表に、詳細は各モデルのページに記載されています。

ヒント

  • 安定性は 0.5 付近にする:表現の豊かさと一貫性のバランスが取れます。均一に聞こえる必要のあるナレーションでは、1 に近づけます。
  • タグは効果を入れたい位置に置く:文の途中にタグを置くと、その位置から話し方が変わります。
  • v3 では長い台本を分割する:5,000 文字を超える場合は、台本を複数のノードに分けるか、Turbo v2.5 に切り替えます。
  • 声をシーンになじませる:響きのない声を動画に重ねると、別の場所で録音したように聞こえることがあります。部屋(屋内)などのリバーブを設定したオーディオ FX(Audio FX)に、声を通します。
  • 複数のクリップの音量をそろえる:ノーマライズをオンにした音量調整(Adjust Volume)にクリップを通して、同じ音量で再生されるようにします。

トラブルシューティング

ボイスのエラーで実行が失敗する:そのボイスは、すでに存在しません。たとえば、ボイスライブラリから削除された場合です。別のボイスを選んで、ノードをもう一度実行してください。

テキストの最後が読み上げられない:テキストがモデルの上限より長く、超えた部分が切り捨てられています。テキストを分割するか、ElevenLabs Turbo v2.5 に切り替えてください。

かっこ内の言葉が読まれない、またはテキストの読み方が不自然:v2 のモデルでオーディオタグを使っています。v2 のモデルは、タグを取り除きます。モデルを ElevenLabs v3 に切り替えるか、タグを削除してください。

API から

POST /v1/text-to-speech で、同じノードをコードから実行できます。リクエストで provider を省略すると、Nodaro が長さに応じてモデルを選びます。5,000 文字以内のテキストは ElevenLabs v3 で、それより長いテキストは Turbo v2.5 で実行されるので、長いテキストが v3 の上限で切られることはありません。自分で設定した provider は、常にそのまま使われます。MCP ツールの generate_speech では、不明なボイス ID は Rachel にフォールバックするので、アシスタントは必ず音声を受け取れます。音声とメディアと MCP ツールを参照してください。

よくある質問

最終更新

目次