テキストから会話
会話全体を 1 つのオーディオファイルに読み上げます。セリフごとにボイスを選び、オーディオタグで感情を加えたり、脚本からセリフを入力したりできます。ElevenLabs Dialogue v3 を使います。
テキストから会話(Text to Dialogue)ノードは、会話全体を 1 つのオーディオファイルに読み上げます。セリフを書いて各セリフにボイスを割り当てると、ElevenLabs Dialogue v3 がそれを順番に、1 つの自然なやり取りとして読み上げます。別々の音声クリップを生成してつなぎ合わせる代わりに、インタビュー、ポッドキャスト風の会話、会話のシーンに使います。
使いどころ
- 2 人以上の話者による、ポッドキャスト風の会話。
- ホストの声とゲストの声によるインタビュー。
- アニメーション動画や解説動画の会話トラック。
- キャラクターごとに 1 つのボイスを割り当てた、オーディオブックの会話シーン。
- 会話をすばやく試すための、オーディオのプロトタイプ。
1 つのボイスでテキストを読み上げる場合は、テキストから音声(Text to Speech)を使います。
クイックスタート
ノードを追加する
キャンバス上で Tab を押し、オーディオ › 音声とナレーション › テキストから会話を選びます。
セリフを書く
設定パネルを開きます。セリフの欄で、最初のセリフのボイスを選び、そのテキストを入力します。会話に新しいセリフを加えるたびに、セリフを追加をクリックします。
または脚本からセリフを入力する
脚本生成(Generate Script)ノードのセリフ出力を、プロンプト入力に接続します。設定パネルで、脚本から 12 行のセリフを入力などの、セリフを入力するボタンをクリックします。次に、話者ごとにボイスを選びます。
実行する
ノードの実行をクリックします。ノードは、すべてのセリフを順番に収めた 1 つのオーディオファイルを返します。
入力
| 入力 | 接続できるノード | 説明 |
|---|---|---|
| プロンプト | 脚本生成などのテキスト系ノード | 脚本生成ノードのセリフ出力が接続されていると、設定パネルに、脚本からセリフを入力するボタンが表示されます。ノードが読み上げるのは、パネルにあるセリフです。 |
出力のオーディオは、すべてのセリフを順番に読み上げた、ひと続きのオーディオファイル 1 つです。
設定
| 設定 | 説明 |
|---|---|
| セリフ | 会話のセリフで、順番に並びます。各セリフには、それぞれのボイスとテキストがあります。セリフの中で [ か / を入力すると、オーディオタグを挿入できます。空のセリフは読み飛ばされます。 |
| セリフを追加 | 最後にセリフを 1 行追加します。ゴミ箱ボタンで、セリフを削除できます。 |
| 脚本から … 行のセリフを入力 | 脚本生成ノードのセリフ出力が接続されているときに表示されます。今あるセリフを、脚本の 1 行につき 1 行ずつのセリフに置き換えます。各セリフには話者の名前が残り、ボイスは最初、デフォルトの Sarah になります。 |
| 安定性 | 最も変化に富む(0)、バランス(0.5)(デフォルト)、最も安定(1.0)のいずれかです。低いほどドラマチックに、高いほど均一になります。 |
| 言語 | 自動検出(デフォルト)か、1 つの言語です。 |
| シード | 0〜4,294,967,295 の整数です。シード、セリフ、設定が同じなら、同じオーディオが再現されます。ランダムなテイクにするには、空欄のままにします。 |
| テキストの正規化 | 自動(デフォルト)、オン、オフのいずれかです。オンにすると、数字、日付、略語が読み方どおりに展開され、自然に聞こえるようになります。 |
入力している間、パネルにはボイス数と文字数が表示されます。たとえば 2/10 voices や 840/5000 です。
制限
| 制限 | 値 |
|---|---|
| すべてのセリフのテキスト | 5,000 文字。2,000 文字以内で最も高い品質になります。 |
| 1 回の実行で使える異なるボイス | 10。同じボイスを複数のセリフで使っても、1 つと数えます。 |
会話には、テキストの入ったセリフが少なくとも 1 行必要です。どのセリフにもテキストがない場合、実行は開始前に拒否されます。
ボイスとオーディオタグ
どのセリフでも、どのボイスでも使えます。標準ボイス、ボイスライブラリのボイス、自分のボイスを自由に組み合わせられます。会話専用のボイスの一覧はありません。
セリフでは、テキストから音声の ElevenLabs v3 と同じオーディオタグを使えます。たとえば [laughs]、[whispers]、[sighs] です。
モデル
テキストから会話は、ElevenLabs Dialogue v3 を使います。料金は、脚本 1,000 文字ごとに決まります。
| モデル | 開発元 | モード | クレジット | 詳細 |
|---|---|---|---|---|
| ElevenLabs Dialogue v3 | ElevenLabs | 複数話者の会話 | 25 | ElevenLabs の API を直接使って複数話者の会話を作るモデルで、台本を渡すと役ごとに声を当てます(既製のボイス、ライブラリのボイス、クローンしたボイスのどれでも使えます)。 |
ヒント
- 話者ごとにはっきり違うボイスを選ぶ:聞き手が会話を追いやすくなります。割り当てる前に、ボイスブラウザーでボイスを試聴してください。
- セリフは会話らしく保つ:1 行に長い段落を詰め込むより、短いセリフを何行かに分けたほうが自然に聞こえます。
- 安定性はバランスから始める:ドラマチックなシーンや感情的なシーンでは下げ、ナレーションのような改まった読み方にしたい場合は上げます。
- 複数の言語が混ざる会話では言語を設定する:1 つの言語なら、自動検出で十分です。話者が言語を切り替える場合は、主な言語を明示的に選びます。
- 長い会話はつなぎ合わせる:長い会話を複数のノードに分け、オーディオを結合(Combine Audio)でパートを順番につなぎます。
API から
同じ生成を、MCP ツール generate_dialogue として使えます。MCP ツールと音声とメディアを参照してください。
よくある質問
関連ページ
テキストから音声
脚本生成
オーディオを結合
オーディオをミックス
ElevenLabs Dialogue v3
最終更新