Nodaro ドキュメント
ドキュメントノードリファレンスモデルAI エージェント(MCP)開発者向けセルフホスティングリサーチ
オーディオ

ボイスチェンジャー Pro

録音や話している動画から各話者を検出し、それぞれを新しい声に差し替えます。元の感情とタイミングはそのまま保たれます。料金は音声 1 分あたりで決まります。

Nodaro Cloud で利用できます

ボイスチェンジャー Pro(Voice Changer Pro)ノードは、会話に登場するすべての話者に、それぞれ新しい声を割り当てます。録音や話している動画から各話者を検出し、話者 1 を 1 つ目のボイスに、話者 2 を 2 つ目のボイスに、というように声を差し替えます。各話者の元の感情、テンポ、タイミングはそのまま保たれるので、会話のシーン、ポッドキャスト、インタビューの全体を 1 回の実行で差し替えられます。

ボイスチェンジャー Pro は Nodaro Cloud で実行されます。セルフホスティング環境では、ノードに NODARO マークが表示され、Nodaro Cloud への接続を通じて実行されます。料金は、接続先の nodaro.ai アカウントに請求されます。

使いどころ

  • 複数のキャラクターが話す会話動画の声を、1 ステップで差し替えます。
  • ポッドキャストやインタビューのすべての声を、匿名の声に置き換えます。
  • 元の演技を保ったまま、シーンに特定のキャラクターボイスを割り当てます。
  • 複数の話者がいる粗い録音を、洗練されたナレーション音声に仕上げます。
  • パネルディスカッションで、ホストの声はそのままに、ゲストの声を差し替えます。

話者が 1 人の録音なら、ボイスチェンジャー(Voice Changer)で十分です。

クイックスタート

ノードを追加する

キャンバス上で Tab を押し、オーディオ › ボイス › ボイスチェンジャー Pro を選びます。

録音を接続する

オーディオ系のノードをオーディオ入力に接続するか、話している動画を動画入力に接続します。

話者ごとにボイスを 1 つ追加する

設定パネルを開きます。話者が最初に話す順に、話者 1 人につき 1 回ずつボイスを追加を使います。声をそのままにする話者には、代わりに元の声を維持:この話者の声は差し替えないをクリックします。

実行する

ノードの実行をクリックします。動画の場合は、声を差し替えた動画が動画出力に、新しいオーディオトラックがオーディオ出力に表示されます。

動画動画動画アップロードインタビュー、話者 3 人ボイスチェンジャー ProRachel、元のまま、Aria字幕を追加
話者が 3 人のインタビュー。ホストは自分の声のままで、2 人のゲストの声が差し替えられ、その結果に字幕が付きます。

入力と出力

入力接続できるノード説明
オーディオオーディオアップロード(Upload Audio)、テキストから会話(Text to Dialogue)などのオーディオ系ノード話者の声を差し替える録音です。ノードはオーディオを返します。
動画動画アップロード(Upload Video)、動画生成(Generate Video)などの動画系ノード声を差し替える、話している動画です。ノードは、新しい声に差し替えた動画を返します。

両方の入力が接続されている場合は動画が優先され、オーディオ入力は無視されます。

出力内容
オーディオ声を差し替えたオーディオです。常に出力されます。動画の場合は、これが新しいオーディオトラックです。
動画声を差し替えた動画です。動画が接続されている場合にだけ出力されます。

モードを決めるのは、入力ではなくファイルです。処理を始める前に、ノードはファイルの実際の中身を確認します。

  • .mp4 や .m4a で保存された声の録音など、オーディオだけのファイルが動画入力に接続されている場合は、オーディオとして処理されます。声を差し替えたオーディオが得られ、動画出力は空のままで、失敗もしません。
  • オーディオ入力に動画が接続されている場合は、まず音声が抽出され、オーディオとして扱われます。

話者にボイスが割り当てられる仕組み

ノードは録音の中の各話者を見つけ、最初に話した順に番号を付けます。ボイスのリストは、その順番に対応付けられます。

設定したリスト話者 1話者 2話者 3話者 4
Rachel、元のまま、AriaRachel元の声Aria元の声
  • ボイスは最大 8 つ:リストには 1〜8 件のエントリを入れられます。少なくとも 1 件は、実際のボイスである必要があります。
  • 元の声を維持するスロット:元のままのエントリに当たる話者は、声が変わりません。それより後の話者の声は、引き続き差し替えられます。
  • 話者より短いリスト:リストの数より後に登場する話者は、元の声のままです。
  • リストを編集する:上下の矢印でボイスを移動したり、保持で元の声を維持するスロットに変えたり、ボイスを削除したりできます。

誰が最初に話すかわからない場合は、話者分離をオンにした文字起こし(Transcribe)に録音を通し、話者のラベルを確認します。

設定

設定説明
ボイスを追加ボイスブラウザーを開き、選んだボイスをリストの最後に追加します。標準ボイス、ボイスライブラリのボイス、自分のボイスのどれでも使えます。
元の声を維持:この話者の声は差し替えない元の声を維持するスロットを、リストの最後に追加します。
モデルMultilingual v2(デフォルト)は 29 の言語に対応し、英語の場合も含めて ElevenLabs が推奨するモデルです。English v2 は英語専用です。
分離の品質高速:声をより多く残す(デフォルト)または品質重視:より精密に分離です。
BGM を保持オン(デフォルト)にすると、分離した音楽と効果音を、新しい声の下に再びミックスします。オフにすると、それらを除いて、声だけの結果にします。
音楽の音量保持した音楽の音量です。ソースに合わせる(デフォルト)は元の音量を保ち、ノーマライズはラウドネスをそろえ、手動では音楽のレベルを 0〜200% で設定します。「BGM を保持」がオンのときだけ使えます。
ボイスエフェクトなし(デフォルト)か、新しい声にかけるリバーブやエコーです。ボイスエフェクトを参照してください。
背景ノイズを除去デフォルトはオフです。結果のノイズを除去します。声はすでに自動で分離されているため、このオプションは不要な場合があります。

ボイスごとの設定

ボイスの下にあるボイス設定を開くと、その話者だけを調整できます。設定に触れなければ、モデルのデフォルトが使われます。

設定説明
変換エンジン声質変換(デフォルト)は、音声を変換し、元の話し方を保ちます。再読み上げ(v3)は、ElevenLabs v3 で文字起こしから新しい演技を生成し、オーディオタグにも対応します。元の話し方は置き換えられ、動画では口の動きが一致しなくなります。
安定性声質変換では 0〜1 です。再読み上げでは、最も変化に富む(0)、バランス(0.5)、最も安定(1.0)のいずれかです。高いほど安定し、低いほど表情豊かになります。
類似度0〜1 です。結果がターゲットのボイスの声質にどれだけ忠実かを決めます。声質変換のみです。
スタイルの誇張0〜1 です。0 より大きくすると話し方を強調しますが、レイテンシーが増え、安定性が下がります。声質変換のみです。
スピーカーブーストターゲットのボイスとの類似性を高めます。レイテンシーはわずかに増えます。声質変換のみです。
音量ソースに合わせる(デフォルト)は、元の話者の音量に合わせます。ノーマライズは、ラウドネスをそろえます。手動では、レベルを 0〜200% で設定します。
シード0〜4,294,967,295 の整数です。ソース、設定、シードが同じなら、この話者の声は同じように差し替えられます。ランダムなシードにするには、空欄のままにします。

背景音を残す仕組み

ボイスを差し替える前に、ノードは必ず録音を、声のトラックと、音楽と効果音のトラックに分けます。BGM を保持は、この分離を行うかどうかを決めるものではありません。音楽のトラックを、新しい声の下に再びミックスするかどうかだけを決めます。

新しい声に音楽が混ざる場合や、声が細く聞こえる場合は、分離の品質を品質重視:より精密に分離にします。速度が重要な場合や、声がすでにクリアに聞こえる場合は、高速のままにします。

声に部屋の響きやエコーを加える

ボイスエフェクトは、音楽が再びミックスされる前に、すべての新しい声にまとめて 1 つのエフェクトを加えます。エフェクトがかかるのは声だけなので、BGM を保持がオンの場合、リバーブのかかった声の下で、音楽はドライなまま残ります。

  • リバーブの空間:部屋(屋内)、浴室、車内、ホール/ロビー、コンサートホール、教会、洞窟、アリーナ/スタジアム、屋外(野外)。0〜100 のウェット/ドライ比で、空間の響きをどれだけ聞かせるかを設定します。
  • 音のキャラクター:電話、メガホン/PA、エコー/スラップバック、カスタム。エコーとカスタムでは、20〜2,000 のディレイ(ms)と、0〜1 のディケイを使います。ディケイが高いほど、繰り返しが多くなります。

各プリセットについては、オーディオ FX(Audio FX)のページで説明しています。

動画全体の声を差し替える

話している動画を動画入力に接続します。するとノードは、次の処理を行います。

  1. クリップから、オーディオトラックを抽出します。
  2. 最初に話した順に、各話者を検出します。
  3. 各話者の声を、対応するボイスに差し替えます。
  4. 新しい声を元の動画に戻し、動画と新しいオーディオトラックを返します。

動画にはオーディオトラックが必要です。テキストから動画や画像から動画のモデルの多くは無音の動画を作るため、無音のクリップはすぐに失敗します。話し声の入ったクリップを使うか、録音をオーディオ入力に接続してください。

クレジット

料金がかかるのは、差し替えたボイスだけです。元の声を維持するスロットの話者と、リストの数より後に登場する話者は、無料でそのまま通過します。

  • 声質変換のボイスは、そのステムの長さで課金されます。ステムは、クリップの先頭からその話者の最後のセリフまでです。料金は 1 分あたり 40 クレジットで、秒単位で計算され、次の整数のクレジットに切り上げられます。
  • 再読み上げのボイスは、読み上げるテキスト 1,000 文字ごとに 30 クレジットで課金されます。1,000 文字未満の端数は切り上げです。
  • 最低料金:どのボイスも最低 4 クレジットかかります。これは 6 秒分の音声にあたります。どの実行も同様に、最低 4 クレジットです。
差し替えるボイスクレジット
最後のセリフが 26.76 秒で終わる、声質変換のボイス 1 つ18
ステムが 60 秒の、声質変換のボイス 1 つ40
ステムが 61 秒の、声質変換のボイス 1 つ41
ステムが 3 秒の、声質変換のボイス 1 つ4(最低料金)
ステムが 60 秒の声質変換のボイス 2 つと、1,500 文字の再読み上げのボイス 1 つ40 + 40 + 60 = 140

料金は実際に変換されたステムの分だけで、実行の開始時に確保された額を超えることはありません。

アプリとして使う

ボイスチェンジャー Pro は、voice.nodaro.ai で単独のアプリとしても使えます。リンクを貼り付けるか動画をアップロードし、話者ごとにボイスを選ぶと、変換された動画が返ってきます。

ヒント

  • ボイスの順番に注意する:対応付けは位置で決まります。1 つ目のボイスは、最初に話した話者に割り当てられます。
  • 話者ごとに調整する:ボイスごとに設定があるので、ある話者は落ち着かせ、別の話者は表情豊かなままにできます。
  • 話者ごとに音量のバランスを取る:各ボイスの音量を使います。ソースに合わせるは元の話者と同じ音量にし、手動では正確なレベルを設定します。
  • 話者より少ないボイスを割り当てる:変わるのはリストにある話者だけで、それより後の話者は全員、自分の声のままです。
  • 演技を保つ:声質変換は音声を音声に変換するので、元の演技がそのまま引き継がれます。再読み上げ(v3)は、オーディオだけのプロジェクトなど、新しい演技が欲しい場合にだけ使います。

トラブルシューティング

ある話者の声がロボットのように聞こえる:そのボイスの類似度か安定性を下げるか、元の話者に声質が近いボイスを選びます。

声に音楽が混ざる:分離の品質を品質重視:より精密に分離にします。

違う話者にボイスが割り当てられた:話者には、最初に話した順に番号が付きます。文字起こしで順番を確認し、ボイスを並べ替えます。

セルフホスティング環境の実行が nodaro_connection_required で拒否される:その環境には、Nodaro Cloud への接続がありません。Nodaro Cloud への接続で説明しているとおり、OAuth か API キーで接続してください。

API から

POST /v1/voice-changer-pro で、このノードをコードから Nodaro Cloud 上で実行できます。orderedVoices は、話者 N をエントリ N に対応付けます。エントリは、ボイス ID、ボイスごとの設定を含むオブジェクト、または元の声を維持するスロットを表す null のいずれかです。設定のオブジェクトは、voiceId、engine("sts" または "v3")、stability、similarityBoost、style、useSpeakerBoost、seed、volumeMode、volume を受け付けます。engine: "v3" では、stability に指定できるのは 0、0.5、1 だけで、similarityBoost、style、useSpeakerBoost は無視されます。結果の sourceHasVideo で、実行が動画モードとオーディオモードのどちらだったかがわかります。

Nodaro Cloud では、同じエンジンを 3 つのステップに分けて実行することもできます。そうすると、差し替えの料金を払う前に話者を確認でき、レンダリングの前にトラックをミックスできます。

  1. 分析:POST /v1/voice-changer-pro/analyze は、声を音楽から分離し、話者を検出します。各話者の時間区間、単語数、文字起こしの抜粋と、検出された言語を返します。料金は 10 クレジットです。
  2. ステムに差し替え:output: "stems" と分析結果を指定して、POST /v1/voice-changer-pro を呼び出します。話者はもう一度検出されないので、ほかのボイスで何度でも差し替えられます。結果は、ボイスごとに 1 本のドライなトラックです。
  3. エクスポート:POST /v1/voice-changer-pro/export は、自分で作ったミックスから最終的な動画をレンダリングします。最大 16 本のトラックを送り、それぞれに 0〜200 の gain、muted、voice か background の kind を指定します。任意で voiceFx も指定できます。少なくとも 1 本のトラックは、ミュートを解除しておく必要があります。映像ストリームはコピーされるだけで、再エンコードされることはありません。ミックスの調整は無料で、エクスポートには 1 クレジットかかります。

SDK のメソッドは client.voices.analyze、client.voices.recast、client.voices.exportMix です。CLI のコマンドは nodaro voice analyze、nodaro voice recast、nodaro voice export です。MCP ツールは voice_changer_pro、voice_changer_pro_analyze、voice_changer_pro_export です。音声とメディアを参照してください。

よくある質問

最終更新

目次