ボイスチェンジャー
録音や話している動画の声を別の声に置き換え、元の感情、テンポ、タイミングはそのまま保ちます。ElevenLabs による音声から音声への変換です。
ボイスチェンジャー(Voice Changer)ノードは、録音の声や、話している動画全体の声を、別の声に置き換えます。ElevenLabs で音声から音声へ変換するため、元の感情、テンポ、タイミングはそのまま残り、声だけが変わります。オーディオを接続するとオーディオが返り、動画を接続すると、新しい声に差し替えた同じ動画が返ります。
使いどころ
- トーキングヘッド動画やリップシンクした動画の声を、1 ステップで差し替えます。
- 録音を、ブランドやキャラクターの声にします。
- 自然な話しぶりを保ったまま、話者の身元を伏せます。
- 仮録りの粗い録音を、完成度の高いナレーションに仕上げます。
- 別々の人が録音した音声に、1 人のナレーターの声を共通して使います。
複数の話者がいて、それぞれに新しい声が必要な会話には、ボイスチェンジャー Pro(Voice Changer Pro)を使います。
クイックスタート
ノードを追加する
キャンバス上で Tab を押し、オーディオ › ボイス › ボイスチェンジャーを選びます。
録音を接続する
オーディオノードをオーディオ入力に接続するか、動画ノードを動画入力に接続します。
新しいボイスを選ぶ
設定パネルを開きます。ボイスでボイスの一覧を開き、適用するボイスを選びます。
実行する
ノードの実行をクリックします。オーディオの場合は、新しい録音がオーディオ出力に出ます。動画の場合は、声を差し替えた動画が動画出力に、その新しい声の音声トラックがオーディオ出力に出ます。
入力と出力
| 入力 | 接続できるノード | 説明 |
|---|---|---|
| オーディオ | オーディオアップロード(Upload Audio)、テキストから音声(Text to Speech)、音声抽出(Voice Extractor)などのオーディオ系ノード | 声を置き換える録音です。ノードはオーディオを返します。 |
| 動画 | 動画アップロード(Upload Video)、動画生成(Generate Video)、リップシンク(Lip Sync)などの動画系ノード | 声を差し替える、話している動画です。ノードは、新しい声に差し替えた動画を返します。 |
両方の入力を接続した場合は動画が優先され、オーディオ入力は無視されます。
| 出力 | 渡す内容 |
|---|---|
| オーディオ | 声を差し替えたオーディオです。常に出力されます。動画の場合は、新しい声の音声トラックです。 |
| 動画 | 声を差し替えた動画です。動画を接続した場合にだけ出力されます。 |
モードを決めるのは、入力ではなくファイル:ノードは、ファイルに実際に何が含まれているかを確認します。.m4a で保存したボイスメモのような、オーディオだけのファイルを動画入力に接続した場合は、オーディオとして実行され、オーディオが返ります。オーディオ入力に接続した動画は、その音声が抽出され、オーディオとして扱われます。
設定
| 設定 | 説明 |
|---|---|
| ボイス | 変換先のボイスです。標準ボイス、ボイスライブラリのボイス、自分のボイスを選べる一覧を開きます。 |
| モデル | Multilingual v2(デフォルト)は 29 言語に対応しています。English v2 は英語専用です。どちらも料金は同じです。 |
| 安定性 | 0〜1 の値です。デフォルトは 0.5 です。値を下げると表現が豊かになり、上げると均一になります。 |
| 類似度 | 0〜1 の値です。デフォルトは 0.75 です。結果が、変換先のボイスの音色にどれだけ近いかを決めます。 |
| スタイルの誇張 | 0〜1 の値です。デフォルトは 0 です。元の話し方の特徴を新しい声により多く反映させますが、レイテンシーが増え、安定性が下がることがあります。 |
| スピーカーブースト | 変換先のボイスへの類似性を強めます。レイテンシーはわずかに増えます。デフォルトはオンです。 |
| シード | 0〜4,294,967,295 の整数です。シード、入力、設定が同じなら、同じ結果になります。ランダムな結果にするには、空欄のままにします。 |
| 背景ノイズを除去 | オフ(デフォルト)では、新しい声の下に音楽と効果音が残ります。オンにすると、それらを取り除き、声だけのクリーンな結果になります。 |
モデル
| モデル | 開発元 | モード | クレジット | 詳細 |
|---|---|---|---|---|
| ElevenLabs Voice Changer | ElevenLabs | ボイスチェンジャー | 40 | 音声から音声への変換で、韻律(抑揚やリズム)を保ったまま、ある声を別の声に変えます。 |
結果を比較したい場合を除き、Multilingual v2 のままにしてください。ElevenLabs は英語の録音にもこのモデルを推奨しています。英語でも English v2 より良い結果になることが多く、ほかの言語の録音ではこのモデルが必須です。
動画全体の声を差し替える
話している動画を動画入力に接続します。生成したクリップ、アップロードしたファイル、リップシンクしたショットのどれでもかまいません。ノードは次の処理を行います。
- クリップから音声トラックを抽出します。
- 話し声を、選んだボイスに変換します。
- 新しい声を元の動画に戻し、その動画と新しい声の音声トラックを返します。
このノード 1 つで、動画、オーディオを抽出(Extract Audio)、声の変換、動画とオーディオを結合(Merge Video & Audio)という 4 つのノードの連なりを置き換えられます。
動画には音声トラックが必要:テキストから動画や画像から動画のモデルの多くは、無音の動画を作ります。変換する話し声をノードに渡せるのは、VEO 3.1 や Kling 3.0 など、音声も生成するモデルだけです。クリップが無音の場合は、オーディオを直接接続してください。
音楽は残すことも、取り除くこともできる:背景ノイズを除去がオフの場合、クリップの音楽と効果音は新しい声の下に残ります。声だけにしたいときは、オンにしてください。
ヒント
- デフォルトから始める:安定性 0.5、類似度 0.75 は、ほとんどの録音に合います。類似度を上げるとボイスにより近くなりますが、不自然に聞こえることがあります。
- スタイルの誇張は 0 のままにする:上げるのは、元の録音のドラマチックな表現を、新しい声でより強く出したいときだけにします。
- 先に元の音声をクリーンにする:質の悪い録音は、その問題が結果にも持ち込まれます。ノイズの多いオーディオは、先に音声抽出を通してください。
- 話し声が中心のクリップを選ぶ:セリフの下で大きな音楽が鳴っていると、変換に混ざることがあります。音楽が不要なときは、背景ノイズを除去をオンにしてください。
- 大きく変えるほど、ニュアンスは失われやすい:元の声と変換先のボイスがかけ離れているほど(たとえば、低い男性の声から軽やかな女性の声へ)、アーティファクトが出やすくなります。
トラブルシューティング
「This video has no audio track to revoice」というエラーで実行が失敗する:クリップが無音です。話し声の入ったクリップを使うか、録音をオーディオ入力に接続してください。
結果がロボットのように聞こえる:類似度を下げてモデルの自由度を上げるか、元の話者に近い変換先のボイスを選んでください。
API から
POST /v1/voice-changer は、voiceId と、audioUrl または videoUrl のどちらかを受け取ります。任意で model、stability、similarityBoost、style、useSpeakerBoost、seed、removeBackgroundNoise も指定できます。結果の sourceHasVideo を見ると、実行が動画モードとオーディオモードのどちらだったかがわかります。MCP ツールは voice_changer です。音声とメディアを参照してください。
よくある質問
関連ページ
ボイスチェンジャー Pro
音声抽出
吹き替え
リップシンク
ElevenLabs Voice Changer
最終更新