# ボイスチェンジャー

> 録音や話している動画の声を別の声に置き換え、元の感情、テンポ、タイミングはそのまま保ちます。ElevenLabs による音声から音声への変換です。

Source: https://nodaro.ai/ja/docs/nodes/audio/voice-changer

**ボイスチェンジャー**（Voice Changer）ノードは、録音の声や、話している動画全体の声を、別の声に置き換えます。ElevenLabs で音声から音声へ変換するため、元の感情、テンポ、タイミングはそのまま残り、声だけが変わります。オーディオを接続するとオーディオが返り、動画を接続すると、新しい声に差し替えた同じ動画が返ります。

- Found in: Audio › Voices
- Output: audio
- API type: `voice-changer`

## 使いどころ
- トーキングヘッド動画やリップシンクした動画の声を、1 ステップで差し替えます。
- 録音を、ブランドやキャラクターの声にします。
- 自然な話しぶりを保ったまま、話者の身元を伏せます。
- 仮録りの粗い録音を、完成度の高いナレーションに仕上げます。
- 別々の人が録音した音声に、1 人のナレーターの声を共通して使います。

複数の話者がいて、それぞれに新しい声が必要な会話には、[**ボイスチェンジャー Pro**（Voice Changer Pro）](https://nodaro.ai/docs/nodes/audio/voice-changer-pro)を使います。

## クイックスタート
### ノードを追加する
キャンバス上で Tab を押し、**オーディオ › ボイス › ボイスチェンジャー**を選びます。

### 録音を接続する
オーディオノードを**オーディオ**入力に接続するか、動画ノードを**動画**入力に接続します。

### 新しいボイスを選ぶ
設定パネルを開きます。**ボイス**でボイスの一覧を開き、適用するボイスを選びます。

### 実行する
ノードの**実行**をクリックします。オーディオの場合は、新しい録音が**オーディオ**出力に出ます。動画の場合は、声を差し替えた動画が**動画**出力に、その新しい声の音声トラックが**オーディオ**出力に出ます。

Workflow: 人物が話すクリップを新しい声にします。動画は字幕の追加へ、新しい声の音声トラックは文字起こしへ進みます。

- 動画アップロード → ボイスチェンジャー (動画)
- ボイスチェンジャー → 字幕を追加 (動画)
- ボイスチェンジャー → 文字起こし (オーディオ)

## 入力と出力
| 入力 | 接続できるノード | 説明 |
| --- | --- | --- |
| **オーディオ** | **オーディオアップロード**（Upload Audio）、**テキストから音声**（Text to Speech）、**音声抽出**（Voice Extractor）などのオーディオ系ノード | 声を置き換える録音です。ノードはオーディオを返します。 |
| **動画** | **動画アップロード**（Upload Video）、**動画生成**（Generate Video）、**リップシンク**（Lip Sync）などの動画系ノード | 声を差し替える、話している動画です。ノードは、新しい声に差し替えた動画を返します。 |

両方の入力を接続した場合は動画が優先され、オーディオ入力は無視されます。

| 出力 | 渡す内容 |
| --- | --- |
| **オーディオ** | 声を差し替えたオーディオです。常に出力されます。動画の場合は、新しい声の音声トラックです。 |
| **動画** | 声を差し替えた動画です。動画を接続した場合にだけ出力されます。 |

**モードを決めるのは、入力ではなくファイル**：ノードは、ファイルに実際に何が含まれているかを確認します。`.m4a` で保存したボイスメモのような、オーディオだけのファイルを**動画**入力に接続した場合は、オーディオとして実行され、オーディオが返ります。**オーディオ**入力に接続した動画は、その音声が抽出され、オーディオとして扱われます。

## 設定
| 設定 | 説明 |
| --- | --- |
| **ボイス** | 変換先のボイスです。標準ボイス、ボイスライブラリのボイス、自分のボイスを選べる一覧を開きます。 |
| **モデル** | **Multilingual v2**（デフォルト）は 29 言語に対応しています。**English v2** は英語専用です。どちらも料金は同じです。 |
| **安定性** | 0〜1 の値です。デフォルトは 0.5 です。値を下げると表現が豊かになり、上げると均一になります。 |
| **類似度** | 0〜1 の値です。デフォルトは 0.75 です。結果が、変換先のボイスの音色にどれだけ近いかを決めます。 |
| **スタイルの誇張** | 0〜1 の値です。デフォルトは 0 です。元の話し方の特徴を新しい声により多く反映させますが、レイテンシーが増え、安定性が下がることがあります。 |
| **スピーカーブースト** | 変換先のボイスへの類似性を強めます。レイテンシーはわずかに増えます。デフォルトはオンです。 |
| **シード** | 0〜4,294,967,295 の整数です。シード、入力、設定が同じなら、同じ結果になります。ランダムな結果にするには、空欄のままにします。 |
| **背景ノイズを除去** | **オフ**（デフォルト）では、新しい声の下に音楽と効果音が残ります。**オン**にすると、それらを取り除き、声だけのクリーンな結果になります。 |

## モデル
| Model | Maker | Modes | Credits | Details |
| --- | --- | --- | --- | --- |
| [ElevenLabs Voice Changer](https://nodaro.ai/docs/models/audio/elevenlabs-voice-changer) | ElevenLabs | Voice changer | 40 | Speech-to-speech: convert one voice to another while preserving prosody. |

結果を比較したい場合を除き、**Multilingual v2** のままにしてください。ElevenLabs は英語の録音にもこのモデルを推奨しています。英語でも English v2 より良い結果になることが多く、ほかの言語の録音ではこのモデルが必須です。

## 動画全体の声を差し替える
話している動画を**動画**入力に接続します。生成したクリップ、アップロードしたファイル、リップシンクしたショットのどれでもかまいません。ノードは次の処理を行います。

1. クリップから音声トラックを抽出します。
2. 話し声を、選んだボイスに変換します。
3. 新しい声を元の動画に戻し、その動画と新しい声の音声トラックを返します。

このノード 1 つで、動画、[**オーディオを抽出**（Extract Audio）](https://nodaro.ai/docs/nodes/video/extract-audio)、声の変換、[**動画とオーディオを結合**（Merge Video & Audio）](https://nodaro.ai/docs/nodes/video/merge-video-audio)という 4 つのノードの連なりを置き換えられます。

**動画には音声トラックが必要**：テキストから動画や画像から動画のモデルの多くは、無音の動画を作ります。変換する話し声をノードに渡せるのは、VEO 3.1 や Kling 3.0 など、音声も生成するモデルだけです。クリップが無音の場合は、オーディオを直接接続してください。

**音楽は残すことも、取り除くこともできる**：**背景ノイズを除去**がオフの場合、クリップの音楽と効果音は新しい声の下に残ります。声だけにしたいときは、オンにしてください。

## ヒント
- **デフォルトから始める**：安定性 0.5、類似度 0.75 は、ほとんどの録音に合います。類似度を上げるとボイスにより近くなりますが、不自然に聞こえることがあります。
- **スタイルの誇張は 0 のままにする**：上げるのは、元の録音のドラマチックな表現を、新しい声でより強く出したいときだけにします。
- **先に元の音声をクリーンにする**：質の悪い録音は、その問題が結果にも持ち込まれます。ノイズの多いオーディオは、先に[音声抽出](https://nodaro.ai/docs/nodes/audio/voice-extractor)を通してください。
- **話し声が中心のクリップを選ぶ**：セリフの下で大きな音楽が鳴っていると、変換に混ざることがあります。音楽が不要なときは、**背景ノイズを除去**をオンにしてください。
- **大きく変えるほど、ニュアンスは失われやすい**：元の声と変換先のボイスがかけ離れているほど（たとえば、低い男性の声から軽やかな女性の声へ）、アーティファクトが出やすくなります。

## トラブルシューティング
**「This video has no audio track to revoice」というエラーで実行が失敗する**：クリップが無音です。話し声の入ったクリップを使うか、録音を**オーディオ**入力に接続してください。

**結果がロボットのように聞こえる**：**類似度**を下げてモデルの自由度を上げるか、元の話者に近い変換先のボイスを選んでください。

## API から
`POST /v1/voice-changer` は、`voiceId` と、`audioUrl` または `videoUrl` のどちらかを受け取ります。任意で `model`、`stability`、`similarityBoost`、`style`、`useSpeakerBoost`、`seed`、`removeBackgroundNoise` も指定できます。結果の `sourceHasVideo` を見ると、実行が動画モードとオーディオモードのどちらだったかがわかります。MCP ツールは `voice_changer` です。[音声とメディア](https://nodaro.ai/docs/developers/api/voice-and-media)を参照してください。

## Frequently asked questions

### ボイスチェンジャーでは、元の感情やタイミングは保たれますか？

はい。音声から音声へ変換するため、録音のテンポ、抑揚、感情はそのまま残り、声だけが変わります。元の演技が良ければ、良い結果が得られます。

### 動画の声を直接変えられますか？

はい。動画を「動画」入力に接続します。ノードは新しい声に差し替えた同じ動画を返し、新しい声の音声トラックを「オーディオ」出力に出します。動画には、話し声を含む音声トラックが必要です。

### どのモデルを選べばよいですか？

デフォルトの Multilingual v2 のままにしてください。ElevenLabs は英語の録音にもこのモデルを推奨しており、ほかの言語ではこのモデルが必須です。English v2 も同じ料金で使えます。

### 新しい声の下に BGM を残せますか？

はい。「背景ノイズを除去」をデフォルトのオフのままにすると、音楽と効果音が新しい声の下に残ります。声だけのクリーンな結果にするには、オンにしてください。

### ボイスチェンジャーとボイスチェンジャー Pro の違いは何ですか？

ボイスチェンジャーは、録音に 1 つのボイスを適用します。ボイスチェンジャー Pro は、会話の中の話者をそれぞれ検出し、話者ごとに別々のボイスを割り当てます。
