# ボイスチェンジャー Pro

> 録音や話している動画から各話者を検出し、それぞれを新しい声に差し替えます。元の感情とタイミングはそのまま保たれます。料金は音声 1 分あたりで決まります。

Source: https://nodaro.ai/ja/docs/nodes/audio/voice-changer-pro

**ボイスチェンジャー Pro**（Voice Changer Pro）ノードは、会話に登場するすべての話者に、それぞれ新しい声を割り当てます。録音や話している動画から各話者を検出し、話者 1 を 1 つ目のボイスに、話者 2 を 2 つ目のボイスに、というように声を差し替えます。各話者の元の感情、テンポ、タイミングはそのまま保たれるので、会話のシーン、ポッドキャスト、インタビューの全体を 1 回の実行で差し替えられます。

ボイスチェンジャー Pro は Nodaro Cloud で実行されます。セルフホスティング環境では、ノードに **NODARO** マークが表示され、[Nodaro Cloud への接続](https://nodaro.ai/docs/self-hosting/cloud-connect)を通じて実行されます。料金は、接続先の nodaro.ai アカウントに請求されます。

- Found in: Audio › Voices
- Output: audio
- API type: `voice-changer-pro`

## 使いどころ
- 複数のキャラクターが話す会話動画の声を、1 ステップで差し替えます。
- ポッドキャストやインタビューのすべての声を、匿名の声に置き換えます。
- 元の演技を保ったまま、シーンに特定のキャラクターボイスを割り当てます。
- 複数の話者がいる粗い録音を、洗練されたナレーション音声に仕上げます。
- パネルディスカッションで、ホストの声はそのままに、ゲストの声を差し替えます。

話者が 1 人の録音なら、[**ボイスチェンジャー**（Voice Changer）](https://nodaro.ai/docs/nodes/audio/voice-changer)で十分です。

## クイックスタート
### ノードを追加する
キャンバス上で Tab を押し、**オーディオ › ボイス › ボイスチェンジャー Pro** を選びます。

### 録音を接続する
オーディオ系のノードを**オーディオ**入力に接続するか、話している動画を**動画**入力に接続します。

### 話者ごとにボイスを 1 つ追加する
設定パネルを開きます。話者が最初に話す順に、話者 1 人につき 1 回ずつ**ボイスを追加**を使います。声をそのままにする話者には、代わりに**元の声を維持：この話者の声は差し替えない**をクリックします。

### 実行する
ノードの**実行**をクリックします。動画の場合は、声を差し替えた動画が**動画**出力に、新しいオーディオトラックが**オーディオ**出力に表示されます。

Workflow: 話者が 3 人のインタビュー。ホストは自分の声のままで、2 人のゲストの声が差し替えられ、その結果に字幕が付きます。

- 動画アップロード → ボイスチェンジャー Pro (動画)
- ボイスチェンジャー Pro → 字幕を追加 (動画)

## 入力と出力
| 入力 | 接続できるノード | 説明 |
| --- | --- | --- |
| **オーディオ** | **オーディオアップロード**（Upload Audio）、**テキストから会話**（Text to Dialogue）などのオーディオ系ノード | 話者の声を差し替える録音です。ノードはオーディオを返します。 |
| **動画** | **動画アップロード**（Upload Video）、**動画生成**（Generate Video）などの動画系ノード | 声を差し替える、話している動画です。ノードは、新しい声に差し替えた動画を返します。 |

両方の入力が接続されている場合は動画が優先され、オーディオ入力は無視されます。

| 出力 | 内容 |
| --- | --- |
| **オーディオ** | 声を差し替えたオーディオです。常に出力されます。動画の場合は、これが新しいオーディオトラックです。 |
| **動画** | 声を差し替えた動画です。動画が接続されている場合にだけ出力されます。 |

**モードを決めるのは、入力ではなくファイルです**。処理を始める前に、ノードはファイルの実際の中身を確認します。

- `.mp4` や `.m4a` で保存された声の録音など、オーディオだけのファイルが**動画**入力に接続されている場合は、オーディオとして処理されます。声を差し替えたオーディオが得られ、**動画**出力は空のままで、失敗もしません。
- **オーディオ**入力に動画が接続されている場合は、まず音声が抽出され、オーディオとして扱われます。

## 話者にボイスが割り当てられる仕組み
ノードは録音の中の各話者を見つけ、最初に話した順に番号を付けます。ボイスのリストは、その順番に対応付けられます。

| 設定したリスト | 話者 1 | 話者 2 | 話者 3 | 話者 4 |
| --- | --- | --- | --- | --- |
| Rachel、元のまま、Aria | Rachel | 元の声 | Aria | 元の声 |

- **ボイスは最大 8 つ**：リストには 1〜8 件のエントリを入れられます。少なくとも 1 件は、実際のボイスである必要があります。
- **元の声を維持するスロット**：**元のまま**のエントリに当たる話者は、声が変わりません。それより後の話者の声は、引き続き差し替えられます。
- **話者より短いリスト**：リストの数より後に登場する話者は、元の声のままです。
- **リストを編集する**：上下の矢印でボイスを移動したり、**保持**で元の声を維持するスロットに変えたり、ボイスを削除したりできます。

誰が最初に話すかわからない場合は、**話者分離**をオンにした[**文字起こし**（Transcribe）](https://nodaro.ai/docs/nodes/audio/transcribe)に録音を通し、話者のラベルを確認します。

## 設定
| 設定 | 説明 |
| --- | --- |
| **ボイスを追加** | ボイスブラウザーを開き、選んだボイスをリストの最後に追加します。標準ボイス、ボイスライブラリのボイス、自分のボイスのどれでも使えます。 |
| **元の声を維持：この話者の声は差し替えない** | 元の声を維持するスロットを、リストの最後に追加します。 |
| **モデル** | **Multilingual v2**（デフォルト）は 29 の言語に対応し、英語の場合も含めて ElevenLabs が推奨するモデルです。**English v2** は英語専用です。 |
| **分離の品質** | **高速：声をより多く残す**（デフォルト）または**品質重視：より精密に分離**です。 |
| **BGM を保持** | **オン**（デフォルト）にすると、分離した音楽と効果音を、新しい声の下に再びミックスします。**オフ**にすると、それらを除いて、声だけの結果にします。 |
| **音楽の音量** | 保持した音楽の音量です。**ソースに合わせる**（デフォルト）は元の音量を保ち、**ノーマライズ**はラウドネスをそろえ、**手動**では**音楽のレベル**を 0〜200% で設定します。「BGM を保持」がオンのときだけ使えます。 |
| **ボイスエフェクト** | **なし**（デフォルト）か、新しい声にかけるリバーブやエコーです。[ボイスエフェクト](#add-a-room-or-an-echo-to-the-voices)を参照してください。 |
| **背景ノイズを除去** | デフォルトはオフです。結果のノイズを除去します。声はすでに自動で分離されているため、このオプションは不要な場合があります。 |

### ボイスごとの設定
ボイスの下にある**ボイス設定**を開くと、その話者だけを調整できます。設定に触れなければ、モデルのデフォルトが使われます。

| 設定 | 説明 |
| --- | --- |
| **変換エンジン** | **声質変換**（デフォルト）は、音声を変換し、元の話し方を保ちます。**再読み上げ（v3）**は、ElevenLabs v3 で文字起こしから新しい演技を生成し、オーディオタグにも対応します。元の話し方は置き換えられ、動画では口の動きが一致しなくなります。 |
| **安定性** | 声質変換では 0〜1 です。再読み上げでは、**最も変化に富む（0）**、**バランス（0.5）**、**最も安定（1.0）**のいずれかです。高いほど安定し、低いほど表情豊かになります。 |
| **類似度** | 0〜1 です。結果がターゲットのボイスの声質にどれだけ忠実かを決めます。声質変換のみです。 |
| **スタイルの誇張** | 0〜1 です。0 より大きくすると話し方を強調しますが、レイテンシーが増え、安定性が下がります。声質変換のみです。 |
| **スピーカーブースト** | ターゲットのボイスとの類似性を高めます。レイテンシーはわずかに増えます。声質変換のみです。 |
| **音量** | **ソースに合わせる**（デフォルト）は、元の話者の音量に合わせます。**ノーマライズ**は、ラウドネスをそろえます。**手動**では、レベルを 0〜200% で設定します。 |
| **シード** | 0〜4,294,967,295 の整数です。ソース、設定、シードが同じなら、この話者の声は同じように差し替えられます。ランダムなシードにするには、空欄のままにします。 |

## 背景音を残す仕組み
ボイスを差し替える前に、ノードは必ず録音を、声のトラックと、音楽と効果音のトラックに分けます。**BGM を保持**は、この分離を行うかどうかを決めるものではありません。音楽のトラックを、新しい声の下に再びミックスするかどうかだけを決めます。

新しい声に音楽が混ざる場合や、声が細く聞こえる場合は、**分離の品質**を**品質重視：より精密に分離**にします。速度が重要な場合や、声がすでにクリアに聞こえる場合は、**高速**のままにします。

## 声に部屋の響きやエコーを加える
**ボイスエフェクト**は、音楽が再びミックスされる前に、すべての新しい声にまとめて 1 つのエフェクトを加えます。エフェクトがかかるのは声だけなので、**BGM を保持**がオンの場合、リバーブのかかった声の下で、音楽はドライなまま残ります。

- **リバーブの空間**：部屋（屋内）、浴室、車内、ホール／ロビー、コンサートホール、教会、洞窟、アリーナ／スタジアム、屋外（野外）。0〜100 の**ウェット／ドライ比**で、空間の響きをどれだけ聞かせるかを設定します。
- **音のキャラクター**：電話、メガホン／PA、エコー／スラップバック、カスタム。エコーとカスタムでは、20〜2,000 の**ディレイ（ms）**と、0〜1 の**ディケイ**を使います。ディケイが高いほど、繰り返しが多くなります。

各プリセットについては、[**オーディオ FX**（Audio FX）](https://nodaro.ai/docs/nodes/audio/audio-fx)のページで説明しています。

## 動画全体の声を差し替える
話している動画を**動画**入力に接続します。するとノードは、次の処理を行います。

1. クリップから、オーディオトラックを抽出します。
2. 最初に話した順に、各話者を検出します。
3. 各話者の声を、対応するボイスに差し替えます。
4. 新しい声を元の動画に戻し、動画と新しいオーディオトラックを返します。

**動画にはオーディオトラックが必要です**。テキストから動画や画像から動画のモデルの多くは無音の動画を作るため、無音のクリップはすぐに失敗します。話し声の入ったクリップを使うか、録音を**オーディオ**入力に接続してください。

## クレジット
料金がかかるのは、差し替えたボイスだけです。元の声を維持するスロットの話者と、リストの数より後に登場する話者は、無料でそのまま通過します。

- **声質変換のボイス**は、そのステムの長さで課金されます。ステムは、クリップの先頭からその話者の最後のセリフまでです。料金は 1 分あたり 40 クレジットで、秒単位で計算され、次の整数のクレジットに切り上げられます。
- **再読み上げのボイス**は、読み上げるテキスト 1,000 文字ごとに 30 クレジットで課金されます。1,000 文字未満の端数は切り上げです。
- **最低料金**：どのボイスも最低 4 クレジットかかります。これは 6 秒分の音声にあたります。どの実行も同様に、最低 4 クレジットです。

| 差し替えるボイス | クレジット |
| --- | --- |
| 最後のセリフが 26.76 秒で終わる、声質変換のボイス 1 つ | 18 |
| ステムが 60 秒の、声質変換のボイス 1 つ | 40 |
| ステムが 61 秒の、声質変換のボイス 1 つ | 41 |
| ステムが 3 秒の、声質変換のボイス 1 つ | 4（最低料金） |
| ステムが 60 秒の声質変換のボイス 2 つと、1,500 文字の再読み上げのボイス 1 つ | 40 + 40 + 60 = 140 |

料金は実際に変換されたステムの分だけで、実行の開始時に確保された額を超えることはありません。

## アプリとして使う
ボイスチェンジャー Pro は、[voice.nodaro.ai](https://voice.nodaro.ai) で単独のアプリとしても使えます。リンクを貼り付けるか動画をアップロードし、話者ごとにボイスを選ぶと、変換された動画が返ってきます。

## ヒント
- **ボイスの順番に注意する**：対応付けは位置で決まります。1 つ目のボイスは、最初に話した話者に割り当てられます。
- **話者ごとに調整する**：ボイスごとに設定があるので、ある話者は落ち着かせ、別の話者は表情豊かなままにできます。
- **話者ごとに音量のバランスを取る**：各ボイスの**音量**を使います。**ソースに合わせる**は元の話者と同じ音量にし、**手動**では正確なレベルを設定します。
- **話者より少ないボイスを割り当てる**：変わるのはリストにある話者だけで、それより後の話者は全員、自分の声のままです。
- **演技を保つ**：声質変換は音声を音声に変換するので、元の演技がそのまま引き継がれます。**再読み上げ（v3）**は、オーディオだけのプロジェクトなど、新しい演技が欲しい場合にだけ使います。

## トラブルシューティング
**ある話者の声がロボットのように聞こえる**：そのボイスの**類似度**か**安定性**を下げるか、元の話者に声質が近いボイスを選びます。

**声に音楽が混ざる**：**分離の品質**を**品質重視：より精密に分離**にします。

**違う話者にボイスが割り当てられた**：話者には、最初に話した順に番号が付きます。[文字起こし](https://nodaro.ai/docs/nodes/audio/transcribe)で順番を確認し、ボイスを並べ替えます。

**セルフホスティング環境の実行が `nodaro_connection_required` で拒否される**：その環境には、Nodaro Cloud への接続がありません。[Nodaro Cloud への接続](https://nodaro.ai/docs/self-hosting/cloud-connect)で説明しているとおり、OAuth か API キーで接続してください。

## API から
`POST /v1/voice-changer-pro` で、このノードをコードから Nodaro Cloud 上で実行できます。`orderedVoices` は、話者 N をエントリ N に対応付けます。エントリは、ボイス ID、ボイスごとの設定を含むオブジェクト、または元の声を維持するスロットを表す `null` のいずれかです。設定のオブジェクトは、`voiceId`、`engine`（`"sts"` または `"v3"`）、`stability`、`similarityBoost`、`style`、`useSpeakerBoost`、`seed`、`volumeMode`、`volume` を受け付けます。`engine: "v3"` では、`stability` に指定できるのは 0、0.5、1 だけで、`similarityBoost`、`style`、`useSpeakerBoost` は無視されます。結果の `sourceHasVideo` で、実行が動画モードとオーディオモードのどちらだったかがわかります。

Nodaro Cloud では、同じエンジンを 3 つのステップに分けて実行することもできます。そうすると、差し替えの料金を払う前に話者を確認でき、レンダリングの前にトラックをミックスできます。

1. **分析**：`POST /v1/voice-changer-pro/analyze` は、声を音楽から分離し、話者を検出します。各話者の時間区間、単語数、文字起こしの抜粋と、検出された言語を返します。料金は 10 クレジットです。
2. **ステムに差し替え**：`output: "stems"` と分析結果を指定して、`POST /v1/voice-changer-pro` を呼び出します。話者はもう一度検出されないので、ほかのボイスで何度でも差し替えられます。結果は、ボイスごとに 1 本のドライなトラックです。
3. **エクスポート**：`POST /v1/voice-changer-pro/export` は、自分で作ったミックスから最終的な動画をレンダリングします。最大 16 本のトラックを送り、それぞれに 0〜200 の `gain`、`muted`、`voice` か `background` の `kind` を指定します。任意で `voiceFx` も指定できます。少なくとも 1 本のトラックは、ミュートを解除しておく必要があります。映像ストリームはコピーされるだけで、再エンコードされることはありません。ミックスの調整は無料で、エクスポートには 1 クレジットかかります。

SDK のメソッドは `client.voices.analyze`、`client.voices.recast`、`client.voices.exportMix` です。CLI のコマンドは `nodaro voice analyze`、`nodaro voice recast`、`nodaro voice export` です。MCP ツールは `voice_changer_pro`、`voice_changer_pro_analyze`、`voice_changer_pro_export` です。[音声とメディア](https://nodaro.ai/docs/developers/api/voice-and-media)を参照してください。

## Frequently asked questions

### ボイスチェンジャー Pro は、どのボイスをどの話者に割り当てるかを、どうやって決めますか？

話者を、最初に話した順に検出します。ボイス 1 は最初に話した話者の声を、ボイス 2 は 2 番目に話した話者の声を差し替え、以降も同様です。リストの数より後に登場する話者は、元の声のままです。

### 一部の話者だけを変更できますか？

はい。自分の声のままにする話者ごとに、「元のまま」のスロットを追加します。たとえば、Rachel、元のまま、Aria と並べると、話者 1 と話者 3 の声が差し替えられ、話者 2 はそのままです。元の声のままの話者には、料金がかかりません。

### ボイスチェンジャー Pro には、何クレジットかかりますか？

差し替える各ボイスは、そのステムの長さ 1 分につき 40 クレジットで、次の整数のクレジットに切り上げられます。ステムは、クリップの先頭からその話者の最後のセリフまでです。再読み上げのボイスは 1,000 文字ごとに 30 クレジット（1,000 文字未満の端数は切り上げ）で、どのボイスも、どの実行も、最低 4 クレジットかかります。

### ボイスチェンジャー Pro では、BGM は残りますか？

はい、デフォルトで残ります。まず音楽と効果音が声から分離され、「BGM を保持」によって、新しい声の下に再びミックスされます。声だけの結果にするには、オフにします。

### セルフホスティング環境で、ボイスチェンジャー Pro を使えますか？

はい。Nodaro Cloud への接続を通じて使えます。ノードは Nodaro Cloud で実行され、料金は接続先の nodaro.ai アカウントに請求されます。接続していない場合、ノードには「nodaro.ai を接続」ボタンが表示されます。
