Nodaro ドキュメント
ドキュメントノードリファレンスモデルAI エージェント(MCP)開発者向けセルフホスティングリサーチ
オーディオ

ボイスチェンジャー

録音や話している動画の声を別の声に置き換え、元の感情、テンポ、タイミングはそのまま保ちます。ElevenLabs による音声から音声への変換です。

ボイスチェンジャー(Voice Changer)ノードは、録音の声や、話している動画全体の声を、別の声に置き換えます。ElevenLabs で音声から音声へ変換するため、元の感情、テンポ、タイミングはそのまま残り、声だけが変わります。オーディオを接続するとオーディオが返り、動画を接続すると、新しい声に差し替えた同じ動画が返ります。

使いどころ

  • トーキングヘッド動画やリップシンクした動画の声を、1 ステップで差し替えます。
  • 録音を、ブランドやキャラクターの声にします。
  • 自然な話しぶりを保ったまま、話者の身元を伏せます。
  • 仮録りの粗い録音を、完成度の高いナレーションに仕上げます。
  • 別々の人が録音した音声に、1 人のナレーターの声を共通して使います。

複数の話者がいて、それぞれに新しい声が必要な会話には、ボイスチェンジャー Pro(Voice Changer Pro)を使います。

クイックスタート

ノードを追加する

キャンバス上で Tab を押し、オーディオ › ボイス › ボイスチェンジャーを選びます。

録音を接続する

オーディオノードをオーディオ入力に接続するか、動画ノードを動画入力に接続します。

新しいボイスを選ぶ

設定パネルを開きます。ボイスでボイスの一覧を開き、適用するボイスを選びます。

実行する

ノードの実行をクリックします。オーディオの場合は、新しい録音がオーディオ出力に出ます。動画の場合は、声を差し替えた動画が動画出力に、その新しい声の音声トラックがオーディオ出力に出ます。

動画動画オーディオ動画アップロード人物が話すクリップボイスチェンジャー新しいボイス字幕を追加文字起こし
人物が話すクリップを新しい声にします。動画は字幕の追加へ、新しい声の音声トラックは文字起こしへ進みます。

入力と出力

入力接続できるノード説明
オーディオオーディオアップロード(Upload Audio)、テキストから音声(Text to Speech)、音声抽出(Voice Extractor)などのオーディオ系ノード声を置き換える録音です。ノードはオーディオを返します。
動画動画アップロード(Upload Video)、動画生成(Generate Video)、リップシンク(Lip Sync)などの動画系ノード声を差し替える、話している動画です。ノードは、新しい声に差し替えた動画を返します。

両方の入力を接続した場合は動画が優先され、オーディオ入力は無視されます。

出力渡す内容
オーディオ声を差し替えたオーディオです。常に出力されます。動画の場合は、新しい声の音声トラックです。
動画声を差し替えた動画です。動画を接続した場合にだけ出力されます。

モードを決めるのは、入力ではなくファイル:ノードは、ファイルに実際に何が含まれているかを確認します。.m4a で保存したボイスメモのような、オーディオだけのファイルを動画入力に接続した場合は、オーディオとして実行され、オーディオが返ります。オーディオ入力に接続した動画は、その音声が抽出され、オーディオとして扱われます。

設定

設定説明
ボイス変換先のボイスです。標準ボイス、ボイスライブラリのボイス、自分のボイスを選べる一覧を開きます。
モデルMultilingual v2(デフォルト)は 29 言語に対応しています。English v2 は英語専用です。どちらも料金は同じです。
安定性0〜1 の値です。デフォルトは 0.5 です。値を下げると表現が豊かになり、上げると均一になります。
類似度0〜1 の値です。デフォルトは 0.75 です。結果が、変換先のボイスの音色にどれだけ近いかを決めます。
スタイルの誇張0〜1 の値です。デフォルトは 0 です。元の話し方の特徴を新しい声により多く反映させますが、レイテンシーが増え、安定性が下がることがあります。
スピーカーブースト変換先のボイスへの類似性を強めます。レイテンシーはわずかに増えます。デフォルトはオンです。
シード0〜4,294,967,295 の整数です。シード、入力、設定が同じなら、同じ結果になります。ランダムな結果にするには、空欄のままにします。
背景ノイズを除去オフ(デフォルト)では、新しい声の下に音楽と効果音が残ります。オンにすると、それらを取り除き、声だけのクリーンな結果になります。

モデル

モデル開発元モードクレジット詳細
ElevenLabs Voice ChangerElevenLabsボイスチェンジャー40音声から音声への変換で、韻律(抑揚やリズム)を保ったまま、ある声を別の声に変えます。

結果を比較したい場合を除き、Multilingual v2 のままにしてください。ElevenLabs は英語の録音にもこのモデルを推奨しています。英語でも English v2 より良い結果になることが多く、ほかの言語の録音ではこのモデルが必須です。

動画全体の声を差し替える

話している動画を動画入力に接続します。生成したクリップ、アップロードしたファイル、リップシンクしたショットのどれでもかまいません。ノードは次の処理を行います。

  1. クリップから音声トラックを抽出します。
  2. 話し声を、選んだボイスに変換します。
  3. 新しい声を元の動画に戻し、その動画と新しい声の音声トラックを返します。

このノード 1 つで、動画、オーディオを抽出(Extract Audio)、声の変換、動画とオーディオを結合(Merge Video & Audio)という 4 つのノードの連なりを置き換えられます。

動画には音声トラックが必要:テキストから動画や画像から動画のモデルの多くは、無音の動画を作ります。変換する話し声をノードに渡せるのは、VEO 3.1 や Kling 3.0 など、音声も生成するモデルだけです。クリップが無音の場合は、オーディオを直接接続してください。

音楽は残すことも、取り除くこともできる:背景ノイズを除去がオフの場合、クリップの音楽と効果音は新しい声の下に残ります。声だけにしたいときは、オンにしてください。

ヒント

  • デフォルトから始める:安定性 0.5、類似度 0.75 は、ほとんどの録音に合います。類似度を上げるとボイスにより近くなりますが、不自然に聞こえることがあります。
  • スタイルの誇張は 0 のままにする:上げるのは、元の録音のドラマチックな表現を、新しい声でより強く出したいときだけにします。
  • 先に元の音声をクリーンにする:質の悪い録音は、その問題が結果にも持ち込まれます。ノイズの多いオーディオは、先に音声抽出を通してください。
  • 話し声が中心のクリップを選ぶ:セリフの下で大きな音楽が鳴っていると、変換に混ざることがあります。音楽が不要なときは、背景ノイズを除去をオンにしてください。
  • 大きく変えるほど、ニュアンスは失われやすい:元の声と変換先のボイスがかけ離れているほど(たとえば、低い男性の声から軽やかな女性の声へ)、アーティファクトが出やすくなります。

トラブルシューティング

「This video has no audio track to revoice」というエラーで実行が失敗する:クリップが無音です。話し声の入ったクリップを使うか、録音をオーディオ入力に接続してください。

結果がロボットのように聞こえる:類似度を下げてモデルの自由度を上げるか、元の話者に近い変換先のボイスを選んでください。

API から

POST /v1/voice-changer は、voiceId と、audioUrl または videoUrl のどちらかを受け取ります。任意で model、stability、similarityBoost、style、useSpeakerBoost、seed、removeBackgroundNoise も指定できます。結果の sourceHasVideo を見ると、実行が動画モードとオーディオモードのどちらだったかがわかります。MCP ツールは voice_changer です。音声とメディアを参照してください。

よくある質問

最終更新

目次