Nodaro ドキュメント
ドキュメントノードリファレンスモデルAI エージェント(MCP)開発者向けセルフホスティングリサーチ
オーディオ

テキストから会話

会話全体を 1 つのオーディオファイルに読み上げます。セリフごとにボイスを選び、オーディオタグで感情を加えたり、脚本からセリフを入力したりできます。ElevenLabs Dialogue v3 を使います。

テキストから会話(Text to Dialogue)ノードは、会話全体を 1 つのオーディオファイルに読み上げます。セリフを書いて各セリフにボイスを割り当てると、ElevenLabs Dialogue v3 がそれを順番に、1 つの自然なやり取りとして読み上げます。別々の音声クリップを生成してつなぎ合わせる代わりに、インタビュー、ポッドキャスト風の会話、会話のシーンに使います。

使いどころ

  • 2 人以上の話者による、ポッドキャスト風の会話。
  • ホストの声とゲストの声によるインタビュー。
  • アニメーション動画や解説動画の会話トラック。
  • キャラクターごとに 1 つのボイスを割り当てた、オーディオブックの会話シーン。
  • 会話をすばやく試すための、オーディオのプロトタイプ。

1 つのボイスでテキストを読み上げる場合は、テキストから音声(Text to Speech)を使います。

クイックスタート

ノードを追加する

キャンバス上で Tab を押し、オーディオ › 音声とナレーション › テキストから会話を選びます。

セリフを書く

設定パネルを開きます。セリフの欄で、最初のセリフのボイスを選び、そのテキストを入力します。会話に新しいセリフを加えるたびに、セリフを追加をクリックします。

または脚本からセリフを入力する

脚本生成(Generate Script)ノードのセリフ出力を、プロンプト入力に接続します。設定パネルで、脚本から 12 行のセリフを入力などの、セリフを入力するボタンをクリックします。次に、話者ごとにボイスを選びます。

実行する

ノードの実行をクリックします。ノードは、すべてのセリフを順番に収めた 1 つのオーディオファイルを返します。

プロンプトオーディオオーディオ脚本生成セリフ出力テキストから会話2 つのボイステキストからオーディオカフェの環境音オーディオをミックス
脚本からセリフを入力し、その会話を、生成した環境音の上にミックスします。

入力

入力接続できるノード説明
プロンプト脚本生成などのテキスト系ノード脚本生成ノードのセリフ出力が接続されていると、設定パネルに、脚本からセリフを入力するボタンが表示されます。ノードが読み上げるのは、パネルにあるセリフです。

出力のオーディオは、すべてのセリフを順番に読み上げた、ひと続きのオーディオファイル 1 つです。

設定

設定説明
セリフ会話のセリフで、順番に並びます。各セリフには、それぞれのボイスとテキストがあります。セリフの中で [ か / を入力すると、オーディオタグを挿入できます。空のセリフは読み飛ばされます。
セリフを追加最後にセリフを 1 行追加します。ゴミ箱ボタンで、セリフを削除できます。
脚本から … 行のセリフを入力脚本生成ノードのセリフ出力が接続されているときに表示されます。今あるセリフを、脚本の 1 行につき 1 行ずつのセリフに置き換えます。各セリフには話者の名前が残り、ボイスは最初、デフォルトの Sarah になります。
安定性最も変化に富む(0)、バランス(0.5)(デフォルト)、最も安定(1.0)のいずれかです。低いほどドラマチックに、高いほど均一になります。
言語自動検出(デフォルト)か、1 つの言語です。
シード0〜4,294,967,295 の整数です。シード、セリフ、設定が同じなら、同じオーディオが再現されます。ランダムなテイクにするには、空欄のままにします。
テキストの正規化自動(デフォルト)、オン、オフのいずれかです。オンにすると、数字、日付、略語が読み方どおりに展開され、自然に聞こえるようになります。

入力している間、パネルにはボイス数と文字数が表示されます。たとえば 2/10 voices や 840/5000 です。

制限

制限値
すべてのセリフのテキスト5,000 文字。2,000 文字以内で最も高い品質になります。
1 回の実行で使える異なるボイス10。同じボイスを複数のセリフで使っても、1 つと数えます。

会話には、テキストの入ったセリフが少なくとも 1 行必要です。どのセリフにもテキストがない場合、実行は開始前に拒否されます。

ボイスとオーディオタグ

どのセリフでも、どのボイスでも使えます。標準ボイス、ボイスライブラリのボイス、自分のボイスを自由に組み合わせられます。会話専用のボイスの一覧はありません。

セリフでは、テキストから音声の ElevenLabs v3 と同じオーディオタグを使えます。たとえば [laughs]、[whispers]、[sighs] です。

モデル

テキストから会話は、ElevenLabs Dialogue v3 を使います。料金は、脚本 1,000 文字ごとに決まります。

モデル開発元モードクレジット詳細
ElevenLabs Dialogue v3ElevenLabs複数話者の会話25ElevenLabs の API を直接使って複数話者の会話を作るモデルで、台本を渡すと役ごとに声を当てます(既製のボイス、ライブラリのボイス、クローンしたボイスのどれでも使えます)。

ヒント

  • 話者ごとにはっきり違うボイスを選ぶ:聞き手が会話を追いやすくなります。割り当てる前に、ボイスブラウザーでボイスを試聴してください。
  • セリフは会話らしく保つ:1 行に長い段落を詰め込むより、短いセリフを何行かに分けたほうが自然に聞こえます。
  • 安定性はバランスから始める:ドラマチックなシーンや感情的なシーンでは下げ、ナレーションのような改まった読み方にしたい場合は上げます。
  • 複数の言語が混ざる会話では言語を設定する:1 つの言語なら、自動検出で十分です。話者が言語を切り替える場合は、主な言語を明示的に選びます。
  • 長い会話はつなぎ合わせる:長い会話を複数のノードに分け、オーディオを結合(Combine Audio)でパートを順番につなぎます。

API から

同じ生成を、MCP ツール generate_dialogue として使えます。MCP ツールと音声とメディアを参照してください。

よくある質問

最終更新

目次