# テキストから音声

> ElevenLabs v3、Turbo v2.5、Multilingual v2 で、テキストを自然な音声にします。ボイスを選び、オーディオタグで感情を加え、最大 46 の言語で読み上げます。

Source: https://nodaro.ai/ja/docs/nodes/audio/text-to-speech

**テキストから音声**（Text to Speech）ノードは、ElevenLabs の音声モデルを使って、テキストを読み上げ音声に変換します。テキストを書くか接続し、ボイスとモデルを選びます。ノードが返すオーディオファイルは、動画に重ねたり、顔にリップシンクさせたり、音楽とミックスしたりできます。デフォルトのモデルである ElevenLabs v3 は 46 の言語を話し、`[laughs]` や `[whispers]` などのオーディオタグにも対応しています。

- Found in: Audio › Speech & Voiceover
- Output: audio
- Credits: 15–30 per run, by model
- Models: 3
- API type: `text-to-speech`

## 使いどころ
- 動画、解説動画、広告のボイスオーバーやナレーションが必要なとき。
- キャラクターにセリフを話させたいとき。たとえば、[**リップシンク**（Lip Sync）](https://nodaro.ai/docs/nodes/video/lip-sync)でポートレートを動かす前の音声です。
- 書いた台本から、ポッドキャスト風の音声を作りたいとき。
- 同じ台本を、複数の言語で読み上げたいとき。
- 感情、リアクション、間をテキストに直接書き込んで、表現豊かに読み上げたいとき。

複数のボイスによる会話を 1 つのファイルにする場合は、代わりに[**テキストから会話**（Text to Dialogue）](https://nodaro.ai/docs/nodes/audio/text-to-dialogue)を使います。

## クイックスタート
### ノードを追加する
キャンバス上で Tab を押し、**オーディオ › 音声とナレーション › テキストから音声**を選びます。

### テキストを渡す
[**テキスト**（Text）](https://nodaro.ai/docs/nodes/automate/text)、[**プロンプト**（Prompt）](https://nodaro.ai/docs/nodes/automate/prompt)、[**脚本生成**（Generate Script）](https://nodaro.ai/docs/nodes/video/generate-script)のいずれかのノードを、**プロンプト**入力に接続します。代わりにノードにテキストを直接入力する場合は、設定パネルを開き、**テキストのソース**を**直接入力**にします。

### ボイスとモデルを選ぶ
**ボイス**でボイスブラウザーを開き、いくつかプレビューを聞いて 1 つ選びます。**モデル**は、もっと長いテキストや安い料金が必要でなければ、**ElevenLabs v3** のままにします。

### 実行する
ノードの**実行**をクリックします。音声がプレーヤー付きでノードに表示されます。それまでの結果も、すべてノードの結果一覧に残ります。

Workflow: 台本がナレーション音声になり、部屋のリバーブで声をシーンになじませてから、その声を動画に結合します。

- テキスト → テキストから音声 (プロンプト)
- テキストから音声 → オーディオ FX (オーディオ)
- オーディオ FX → 動画とオーディオを結合 (オーディオ)
- 動画生成 → 動画とオーディオを結合 (動画)

## 入力
| 入力 | 接続できるノード | 説明 |
| --- | --- | --- |
| **プロンプト** | テキスト、プロンプト、脚本生成、**テキストを結合**（Combine Text）などのテキスト系ノード | **テキストのソース**が**接続されたノードから**のときに、読み上げるテキストです。 |

出力の**オーディオ**は、読み上げた音声の URL です。いくつのノードにでも同時に渡せます。

## 設定
| 設定 | 説明 |
| --- | --- |
| **テキストのソース** | **接続されたノードから**（デフォルト）は、**プロンプト**に接続されたテキストを読み上げます。**直接入力**は、**テキスト**に入力したテキストを読み上げます。 |
| **テキスト** | テキストのソースが**直接入力**のときに、読み上げるテキストです。`[` か `/` を入力すると、オーディオタグを挿入できます。`{Script}` のように、ほかのノードのラベルを波かっこで囲んで書くと、そのノードの値を入れられます。 |
| **モデル** | **ElevenLabs v3**（デフォルト）、**ElevenLabs Turbo v2.5**、**ElevenLabs Multilingual v2** のいずれかです。 |
| **ボイス** | 読み上げるボイスです。ボイスブラウザーが開きます。デフォルトは **Rachel** です。 |
| **言語** | **自動検出**（デフォルト）か、モデルの一覧にある言語の 1 つです。 |
| **安定性** | 0〜1 です。値が低いほど表情豊かで変化に富み、高いほど均一に聞こえます。 |
| **類似度** | 0〜1 です。結果がボイスの声質にどれだけ近いかを決めます。Turbo v2.5 と Multilingual v2 のみです。 |
| **スタイルの誇張** | 0〜1 です。元のボイスのスタイルを強めます。Turbo v2.5 と Multilingual v2 のみです。 |
| **速度** | `0.7x`〜`1.2x` です。Turbo v2.5 と Multilingual v2 のみです。 |
| **前後のテキスト** | 読み上げるテキストの前後に必ず追加されるテキストです。ワークフローをアプリとして使う人には表示されません。[プロンプトの前後のテキスト](https://nodaro.ai/docs/concepts/prompt-pre-post-text)を参照してください。 |

**ボイスの設定は、プレビューの設定に従います**。スライダーを動かさなければ、ノードはボイスに保存されている設定を使います。これは、そのボイスのプレビューを作ったときと同じ設定です。そのため、結果は聞いたプレビューと同じように聞こえます。スライダーを動かすと、変わるのはその値だけで、ボイスのほかの保存済みの設定はそのまま使われます。

![テキストから音声の設定パネル。「テキストのソース」「モデル」「ボイス」「言語」と、「安定性」のスライダーがあります。](https://nodaro.ai/docs-media/screens/en/nodes/text-to-speech/settings.light.webp)

## モデル
テキストから音声では、以下の 3 つの ElevenLabs 音声モデルを実行できます。モデルをクリックすると、クレジットの料金を確認できます。

| Model | Maker | Modes | Credits | Details |
| --- | --- | --- | --- | --- |
| [ElevenLabs v3](https://nodaro.ai/docs/models/audio/elevenlabs-v3) | ElevenLabs | Text to speech | 30 | Latest ElevenLabs TTS — supports [audio tags] for emotion / pacing. Direct API. |
| [ElevenLabs Turbo v2.5](https://nodaro.ai/docs/models/audio/elevenlabs-turbo-v2-5) | ElevenLabs | Text to speech | 15 | Fast, cheap ElevenLabs TTS via the direct ElevenLabs API. Good for narration. |
| [ElevenLabs Multilingual v2](https://nodaro.ai/docs/models/audio/elevenlabs-multilingual-v2) | ElevenLabs | Text to speech | 30 | Multi-language ElevenLabs TTS via the direct ElevenLabs API. |

| モデル | 言語 | オーディオタグ | 1 回の実行あたりの文字数 |
| --- | --- | --- | --- |
| **ElevenLabs v3**（デフォルト） | 46 | 対応 | 5,000 |
| **ElevenLabs Turbo v2.5** | 32 | 非対応。読み上げる前に取り除かれます | 40,000 |
| **ElevenLabs Multilingual v2** | 29 | 非対応。読み上げる前に取り除かれます | 10,000 |

### どのモデルを選ぶか
- **ElevenLabs v3**：デフォルトです。表現豊かな音声、オーディオタグ、最も幅広い言語対応が必要なときに選びます。
- **ElevenLabs Turbo v2.5**：より安く、より高速です。シンプルなナレーションや、1 回の実行で最大 40,000 文字の長いテキストに選びます。
- **ElevenLabs Multilingual v2**：29 の言語で自然に読み上げます。1 回の実行で最大 10,000 文字です。

Nodaro のすべてのオーディオモデルについては、[モデルの選び方](https://nodaro.ai/docs/guides/choosing-models)を読んでください。

## ボイスを選ぶ
ボイスブラウザーには、3 つのタブがあります。

- **標準ボイス**：ElevenLabs の標準のボイスです。
- **マイボイス**：すでに持っているカスタムボイスです。説明から新しいボイスを作るには、[**ボイスデザイン**（Voice Design）](https://nodaro.ai/docs/nodes/audio/voice-design)を使います。
- **ボイスライブラリ**：ElevenLabs の共有ライブラリです。検索と、アクセント、年齢、言語、用途、トーンのフィルターを使えます。

どのボイスにも、選ぶ前に再生できるプレビューがあります。

ボイスライブラリの各ボイスは、作成者が特定のモデル向けに検証しています。ノードが Turbo v2.5 か Multilingual v2 で動いていて、そのモデル向けに検証されていないライブラリのボイスを選んだとします。するとノードは、**モデル**を、そのボイスが検証されているモデルに切り替えます。ElevenLabs v3 はどのボイスでも生成できるので、v3 のノードが切り替えられることはありません。

## オーディオタグで感情を加える
ElevenLabs v3 は、オーディオタグを読み取ります。オーディオタグは角かっこで囲んだ短い指示で、テキストの中の、効果を入れたい位置に置きます。たとえば `I can't believe it [laughs] that's amazing` です。

| 種類 | 例 |
| --- | --- |
| 感情 | `[excited]`、`[sad]`、`[angry]` |
| リアクション | `[laughs]`、`[sighs]`、`[gasps]` |
| 話し方 | `[whispers]`、`[shouting]` |
| 間の取り方 | `[pause]`、`[long pause]` |
| トーン | `[cheerfully]`、`[deadpan]` |
| 効果音 | `[applause]`、`[thunder]` |

v2 のモデルは、読み上げる前にオーディオタグを取り除くため、残ったテキストが不自然に読まれることがあります。v2 のモデルで間を入れるには、代わりに `<break time="1.0s" />` のような break タグを使います。

### 違いを聞く
以下の 2 つのテイクは、どちらも ElevenLabs v3 と標準ボイスの Rachel を使っています。1 つ目は 2 つのオーディオタグ付きでテキストを読み上げ、2 つ目はタグなしで同じ言葉を読み上げています。

```
I looked everywhere for it. [whispers] And then I found it, right under the old map. [laughs] It was there the whole time.
```

Audio: [[whispers] と [laughs] の 2 つのタグを入れた場合。](https://nodaro.ai/docs-media/examples/text-to-speech/with-tags.mp3)
Audio: [タグを入れずに、同じ言葉を読み上げた場合。](https://nodaro.ai/docs-media/examples/text-to-speech/plain.mp3)

## 言語
ほとんどのテキストは、**自動検出**で問題なく読み上げられます。英語以外のテキストでは、言語を明示的に選ぶと、発音がよくなることがあります。

- **Multilingual v2（29 言語）**：英語、日本語、中国語、ドイツ語、ヒンディー語、フランス語、韓国語、ポルトガル語、イタリア語、スペイン語、インドネシア語、オランダ語、トルコ語、フィリピン語、ポーランド語、スウェーデン語、ブルガリア語、ルーマニア語、アラビア語、チェコ語、ギリシャ語、フィンランド語、クロアチア語、マレー語、スロバキア語、デンマーク語、タミル語、ウクライナ語、ロシア語。
- **Turbo v2.5（32 言語）**：Multilingual v2 のすべての言語に加えて、ハンガリー語、ノルウェー語、ベトナム語。
- **v3（46 言語）**：Turbo v2.5 のすべての言語に加えて、ヘブライ語、タイ語、ベンガル語、ウルドゥー語、ペルシア語、セルビア語、リトアニア語、ラトビア語、エストニア語、ジョージア語、アイスランド語、カタルーニャ語、アフリカーンス語、スワヒリ語。

## クレジット
料金はモデルによって異なり、最も安いのは ElevenLabs Turbo v2.5 です。各モデルの料金は[モデル](#models)の表に、詳細は各モデルのページに記載されています。

## ヒント
- **安定性は 0.5 付近にする**：表現の豊かさと一貫性のバランスが取れます。均一に聞こえる必要のあるナレーションでは、1 に近づけます。
- **タグは効果を入れたい位置に置く**：文の途中にタグを置くと、その位置から話し方が変わります。
- **v3 では長い台本を分割する**：5,000 文字を超える場合は、台本を複数のノードに分けるか、Turbo v2.5 に切り替えます。
- **声をシーンになじませる**：響きのない声を動画に重ねると、別の場所で録音したように聞こえることがあります。**部屋（屋内）**などのリバーブを設定した[**オーディオ FX**（Audio FX）](https://nodaro.ai/docs/nodes/audio/audio-fx)に、声を通します。
- **複数のクリップの音量をそろえる**：**ノーマライズ**をオンにした[**音量調整**（Adjust Volume）](https://nodaro.ai/docs/nodes/audio/adjust-volume)にクリップを通して、同じ音量で再生されるようにします。

## トラブルシューティング
**ボイスのエラーで実行が失敗する**：そのボイスは、すでに存在しません。たとえば、ボイスライブラリから削除された場合です。別のボイスを選んで、ノードをもう一度実行してください。

**テキストの最後が読み上げられない**：テキストがモデルの上限より長く、超えた部分が切り捨てられています。テキストを分割するか、ElevenLabs Turbo v2.5 に切り替えてください。

**かっこ内の言葉が読まれない、またはテキストの読み方が不自然**：v2 のモデルでオーディオタグを使っています。v2 のモデルは、タグを取り除きます。**モデル**を ElevenLabs v3 に切り替えるか、タグを削除してください。

## API から
`POST /v1/text-to-speech` で、同じノードをコードから実行できます。リクエストで `provider` を省略すると、Nodaro が長さに応じてモデルを選びます。5,000 文字以内のテキストは ElevenLabs v3 で、それより長いテキストは Turbo v2.5 で実行されるので、長いテキストが v3 の上限で切られることはありません。自分で設定した `provider` は、常にそのまま使われます。MCP ツールの `generate_speech` では、不明なボイス ID は Rachel にフォールバックするので、アシスタントは必ず音声を受け取れます。[音声とメディア](https://nodaro.ai/docs/developers/api/voice-and-media)と [MCP ツール](https://nodaro.ai/docs/mcp/tools)を参照してください。

## Frequently asked questions

### 「テキストから音声」では、どのモデルを選べばよいですか？

まずはデフォルトの ElevenLabs v3 から始めてください。46 の言語を話し、感情や間の取り方を指定するオーディオタグにも対応しています。安くシンプルなナレーションを作る場合や、長いテキストには、ElevenLabs Turbo v2.5 を使います。1 回の実行で最大 40,000 文字まで受け付けるためです。

### テキストは、どれくらいの長さまで入力できますか？

1 回の実行で読み上げられるのは、ElevenLabs v3 で最大 5,000 文字、Multilingual v2 で最大 10,000 文字、Turbo v2.5 で最大 40,000 文字です。それより長いテキストは、拒否されるのではなく、上限まで短縮されます。短縮される前に、設定パネルに警告が表示されます。

### ボイスに笑わせたり、ささやかせたり、間を取らせたりするには、どうすればよいですか？

ElevenLabs v3 で、効果を入れたい位置に、角かっこで囲んだオーディオタグを書きます。たとえば「I can't believe it [laughs] that's amazing」のように書きます。v2 のモデルは、読み上げる前にオーディオタグを取り除きます。

### 自分のボイスを使えますか？

すでに持っているカスタムボイスは、ボイスブラウザーの「マイボイス」に表示されます。文章の説明から新しいカスタムボイスを作るには、ボイスデザインノードを使います。

### 選んだボイスが削除されていた場合は、どうなりますか？

実行は、内容のわかるエラーとともに失敗します。Nodaro が知らせずに別のボイスに差し替えることはないので、別のボイスを選んで、ノードをもう一度実行してください。
