Nodaro ドキュメント
ドキュメントノードリファレンスモデルAI エージェント(MCP)開発者向けセルフホスティングリサーチ
ツールリファレンス

オーディオ

Nodaro MCP のオーディオツールで、音声や会話の生成、ボイスのデザインと変更、吹き替え、効果音の作成、文字起こし、オーディオのクリーンアップやトリミングを行います。

オーディオツールを使うと、アシスタントは Nodaro で音を作ったり変えたりできます。音声と会話、新しいボイスとボイスの変更、吹き替え、効果音、文字起こし、クリーンアップに対応しています。list_voices 以外の各ツールはジョブを開始してその ID を返し、結果はライブラリに保存されます。どのオーディオツールにも workflows:execute 権限が必要です。

ツール機能
generate_speechボイスを指定したテキストの読み上げ
generate_dialogue複数のボイスによる会話を 1 つのファイルに
list_voices標準ボイスの一覧
voice_design説明から新しいボイスを作成
voice_remixボイス ID を使わず、説明したボイスで読み上げ
voice_changer録音や動画の声を変更
voice_changer_pro複数の話者の声を一度に変更
dubbing声を保ったまま、音声を別の言語に翻訳
text_to_audio説明から効果音を作成
transcribe単語のタイミング付きで、音声をテキストに変換
audio_isolationミックスからメインの声や音を分離
separate_audioオーディオを、ボーカルとインストゥルメンタル、またはステムに分割
apply_audio_fx声を空間に置くリバーブとエフェクト
trim_audioオーディオをトリミング、または動画から抽出
download_youtube_audioYouTube 動画のオーディオトラック

generate_speech

ElevenLabs のボイスで、テキストを音声に変換します。テキストから音声(Text to Speech)ノードと同じように動作します。

権限:workflows:execute。クレジット:下記のモデルの料金です。

モデル開発元モードクレジット詳細
ElevenLabs v3ElevenLabsテキストから音声30テキストから音声を生成する最新の ElevenLabs のモデルで、感情や話すテンポを指定する [audio tags] に対応しています。ElevenLabs の API を直接使います。
ElevenLabs Turbo v2.5ElevenLabsテキストから音声15ElevenLabs の API を直接使って、高速かつ安価にテキストから音声を生成します。ナレーションに向いています。
ElevenLabs Multilingual v2ElevenLabsテキストから音声30ElevenLabs の API を直接使って、多言語でテキストから音声を生成します。
パラメーター型説明
textstring必須。読み上げる内容で、最大 5,000 文字です。それより長い台本は、複数の呼び出しに分けます。
voice_idstring標準ボイスの名前か、自分でクローンしたボイスの ID です。デフォルトは Rachel です。不明な ID を指定すると、voice_not_found で失敗します。
voice_typestringpremade、custom、library のいずれかです。
modelstringelevenlabs-v3(デフォルト)、elevenlabs-turbo、elevenlabs-multilingual のいずれかです。
language_codestringテキストの言語です。
stability, similarity_boost, stylenumber話し方の設定で、0〜1 です。
speednumber0.7〜1.2 です。
presetIdstringlist_node_presets で取得できる、話し方のプリセットです。たとえば落ち着いたナレーター(Calm Narrator)、CM ナレーション(Commercial Read)、オーディオブック(Audiobook)です。プリセットを使う場合も、text は指定します。

モデルの選び方:ElevenLabs v3 は、感情や間の取り方を指定する [laughs]、[whispers]、[sighs] などのオーディオタグに対応しています。また、完全な多言語対応なので、ヘブライ語、アラビア語、中国語、日本語、韓国語を含むすべての言語に使ってください。ElevenLabs Turbo は、シンプルなナレーションをより安く作れます。ElevenLabs Multilingual v2 は旧世代のモデルです。v2 でしか動かないことがわかっているボイスにだけ使ってください。

ボイスの選び方:標準ボイスは、Rachel、Aria、Roger、Sarah、Laura、Charlie、George、Callum、River、Liam、Charlotte です。さらに、Alice、Matilda、Will、Jessica、Eric、Chris、Brian、Daniel、Lily、Bill があります。温かみのある女性の声なら Rachel、若い女性の声なら Aria か Lily、深みのある男性の声なら Roger か Brian、ニュートラルな男性の声なら George か Daniel、イギリス英語の声なら Charlie か Charlotte を試してください。

戻り値:ジョブ ID です。音声の準備ができると、カードで再生されます。

generate_dialogue

複数の話者による台本を、ElevenLabs Dialogue v3 で、自然な話者交代を含む 1 つのオーディオファイルとして読み上げます。会話、インタビュー、ポッドキャスト風のやり取り、シーンには、generate_speech のクリップを別々につなげる代わりに、このツールを使います。テキストから会話(Text to Dialogue)ノードと同じように動作します。

権限:workflows:execute。クレジット:ElevenLabs Dialogue v3 の料金で、1,000 文字ごとに課金されます。

パラメーター型説明
dialoguearray必須。話す順に並べたセリフで、1〜200 件です。各セリフは { text, voice_id } です。同じキャラクターには同じボイスを使います。セリフには [laughs] などのオーディオタグを入れられます。
stabilitynumber0(最も変化に富む)、0.5(バランス)、1(最も安定)のいずれかです。
language_codestring言語のヒントです。たとえば en や he です。省略すると、言語が自動で検出されます。
seedinteger再現できる結果にするための、固定のシードです。
apply_text_normalizationstring数字、日付、略語を、読み上げる形に展開します。auto(デフォルト)、on、off のいずれかです。

上限は、合計 5,000 文字と、1 回の呼び出しあたり 10 種類のボイスです。最高の品質を得るには、2,000 文字以下をおすすめします。同じ台本の中で、標準ボイスの名前とクローンしたボイスを混在させられます。

戻り値:ジョブ ID です。

list_voices

標準ボイスを、ID、名前と、性別、アクセント、説明などの詳細(ある場合)とともに返します。generate_speech、voice_changer、voice_changer_pro には、ボイス ID が必要です。

権限:workflows:execute。クレジット:無料。

このツールにパラメーターはありません。カタログを読み取るだけで、ジョブは開始しません。

voice_design

説明から新しいボイスをデザインし、そのボイスで台本を読み上げたサンプルを返します。ボイスを保存する前に、試聴するのに使います。ボイスデザイン(Voice Design)ノードと同じように動作します。

権限:workflows:execute。クレジット:50。

パラメーター型説明
voice_descriptionstring必須。性別、年齢、アクセント、トーン、キャラクターなど、ボイスの説明で、最大 1,000 文字です。たとえば「warm female narrator with a soft British accent, low-pitched, calm pacing」です。
textstring必須。ボイスに読み上げさせるサンプルの台本で、100〜1,000 文字です。
modelstringeleven_ttv_v3(デフォルト。すべての言語に対応)か、旧世代の eleven_multilingual_ttv_v2 です。
loudness, guidance_scale, quality, seed, should_enhance任意のデザイン設定です。loudness は -1〜1、guidance_scale は 0〜100 です。

戻り値:ジョブ ID です。結果は、デザインしたボイスのオーディオサンプルです。

voice_remix

言葉で説明したボイスで、ボイス ID を使わずにテキストを読み上げます。保存しておく必要のない、一度きりのボイスに使います。ボイスリミックス(Voice Remix)ノードと同じように動作します。

権限:workflows:execute。クレジット:40。

パラメーター型説明
textstring必須。読み上げる内容で、最大 5,000 文字です。
voice_descriptionstring必須。ボイスの説明で、最大 1,000 文字です。たとえば「a warm, mid-40s British woman with a calm news-anchor tone」です。

戻り値:ジョブ ID です。

voice_changer

話し方とリズムを保ったまま、オーディオトラックや、話している動画全体の声を差し替えます。ボイスチェンジャー(Voice Changer)ノードと同じように動作します。

権限:workflows:execute。クレジット:40。

パラメーター型説明
voice_idstring必須。新しいボイスです。標準ボイスの名前か、自分でクローンしたボイスの ID を指定します。
audio_url or audio_asset_idstringオーディオのソースです。
video_url or video_asset_idstring代わりに使う、動画のソースです。両方を渡した場合は、動画が優先されます。
remove_background_noisebooleantrue にすると、クリーンな声だけを返します。false にすると、音楽と効果音を新しい声の下に残します。
stability, similarity_boost, stylenumber0〜1 です。style は、元の話し方を誇張します。0 より大きくすると処理が遅くなり、安定性が下がることがあります。

戻り値:ジョブ ID です。ソースが動画の場合、カードでは新しいオーディオをプレビューでき、新しい動画はライブラリに保存されます。

voice_changer_pro

クリップ内のすべての話者を検出し、言葉とタイミングを保ったまま、それぞれに新しいボイスを割り当てます。最初に話した順に、話者 1 にはリストの 1 つ目のボイス、話者 2 には 2 つ目のボイス、というように割り当てられます。ボイスチェンジャー Pro(Voice Changer Pro)ノードと同じように動作します。

権限:workflows:execute。クレジット:ボイスチェンジャー Pro ノードと同じです。Nodaro Cloud のみ。

パラメーター型説明
ordered_voicesarray必須。話者 1 人につき 1 つで、1〜8 件のエントリーです。各エントリーは、ボイス ID、独自の設定を持つオブジェクト、またはその話者の元の声を保つ null のいずれかです。少なくとも 1 件は、null 以外にする必要があります。
audio_url, audio_asset_id, video_url or video_asset_idstringソースです。オーディオトラックか、声を差し替える動画を指定します。
analysisobject以前の voice_changer_pro_analyze ジョブの出力です。これを渡すと、話者をもう一度検出するのではなく、ボイスを割り当てたときの話者リストをそのまま使って変更します。
preserve_backgroundboolean音楽と効果音を、新しい声の下に再びミックスします。デフォルトは true です。
music_volume_mode, music_volume背景音の音量です。match(元の音量)、normalize、または 0〜200 の音量を指定する manual です。
voice_fxobject背景音を戻す前に、新しい声にかけるリバーブやエフェクトです。room、hall、church、telephone、echo などの preset に、wetDryMix、delayMs、decay を組み合わせます。
separation_qualitystringfast(デフォルト)または best です。
remove_background_noiseboolean最初に背景ノイズを除去し、声だけのクリーンな結果にします。
outputstring完成した動画を返す video(デフォルト)か、voice_changer_pro_export で自分でミックスするための個別のトラックを返す stems です。
modelstringボイスモデルを上書きします。

ボイスのエントリーのオブジェクトは、voiceId と、任意の engine、stability、similarityBoost、style、useSpeakerBoost、seed、volumeMode、volume を受け付けます。engine は、元の演技の声を差し替える sts(デフォルト)か、ElevenLabs v3 で文字起こしからセリフを読み上げ直す v3 です。v3 エンジンは、オーディオタグと、0、0.5、1 のいずれかの安定性を受け付けます。文字起こしは analysis から読み取り、分析がない場合は独自に文字起こしを行います。

戻り値:ジョブ ID です。

voice_changer_pro_analyze

クリップ内の話者を、変更せずに検出します。インタラクティブな流れの最初のステップです。ジョブの出力には、分離された声と背景音のトラック、各話者とその時間区間、最初の登場位置、単語数、テキストの抜粋、そして言語が含まれます。出力を確認して、各話者のボイスを選んだり、拍手など、人ではない「話者」を見つけたりします。

権限:workflows:execute。Nodaro Cloud のみ。

パラメーター型説明
audio_url, audio_asset_id, video_url or video_asset_idstringソースのクリップです。
separation_qualitystringfast(デフォルト)または best です。
suggest_titleboolean文字起こしからタイトルも提案し、suggestedTitle として返します。

戻り値:ジョブ ID です。その output_data を、analysis として voice_changer_pro に渡します。

voice_changer_pro_export

自分で作ったトラックのミックスから、完成した動画をレンダリングします。output: "stems" を指定した voice_changer_pro の後に行う、インタラクティブな流れの最後のステップです。映像は再エンコードされずにコピーされます。

権限:workflows:execute。Nodaro Cloud のみ。

パラメーター型説明
tracksarray必須。1〜16 本のトラックです。各トラックには、url、0〜200 の gain(100 で変化なし)、muted、kind を指定します。kind は voice(デフォルト)か background です。少なくとも 1 本は、ミュートされていないトラックが必要です。
video_url or video_asset_idstringソースの動画です。
voice_fxobjectボイスのトラックにだけかけるエフェクトです。

戻り値:ジョブ ID です。

dubbing

各話者の声とタイミングを保ったまま、音声を別の言語に翻訳します。ソースが動画の場合は、吹き替えた動画とそのオーディオトラックが返されます。吹き替え(Dubbing)ノードと同じように動作します。

権限:workflows:execute。クレジット:吹き替える区間の 1 分ごとに課金されます。

パラメーター型説明
target_languagestring必須。言語コードです。たとえば en、es、fr、de、ja、zh、ko、ar です。
audio_url, audio_asset_id, video_url, video_asset_id or source_urlstringソースは 1 つだけ指定します。source_url には、公開されている YouTube や TikTok のリンク、またはファイルへの直接リンクを指定します。リンク先は直接取得されます。
source_languagestringソースの言語のヒントです。省略すると、自動で検出されます。
num_speakersinteger異なる声の数で、最大 20 です。0 にすると、自動で検出します。
disable_voice_cloningboolean各話者自身の声ではなく、似た声のネイティブのボイスを使います。
drop_background_audioboolean背景音を取り除きます。音声だけのソースに使います。
start_time, end_timenumberソースの一部だけを吹き替えます。単位は秒です。
highest_resolutionboolean動画のソースの解像度を保ちます。処理は遅くなります。
use_profanity_filter, target_accent, watermark任意です。target_accent は、声を特定のアクセントに近づけます。

1 回の吹き替えで扱えるのは、最大 30 分です。それより長いソースの一部を吹き替えるには、start_time と end_time を使います。

戻り値:ジョブ ID です。

text_to_audio

説明から効果音を作ります。フォーリー、環境音、インターフェースの効果音などです。音声や音楽には使いません。テキストからオーディオ(Text to Audio)ノードと同じように動作します。

権限:workflows:execute。クレジット:ElevenLabs Sound Effects の料金です。

パラメーター型説明
promptstring音の説明で、最大 2,000 文字です。たとえば「thunderstorm with heavy rain」です。プリセットが指定する場合を除き、必須です。
durationnumber0.5〜30 秒です。デフォルトでは、モデルが長さを決めます。
loopboolean音が途切れずにループするようにします。
prompt_influencenumber音がプロンプトにどれだけ忠実に従うかで、0〜1 です。
presetIdstringプリセットです。たとえば雨の環境音(Rain Ambience)、風切り音のトランジション(Whoosh Transition)、インパクト/ドーン(Impact / Boom)です。

戻り値:ジョブ ID です。

transcribe

ElevenLabs STT エンジンで、オーディオファイルや動画ファイルの音声をテキストに変換します。単語のタイミングはミリ秒単位で、常に output_data.json.words に入ります。文字起こし(Transcribe)ノードと同じように動作します。

権限:workflows:execute。クレジット:ElevenLabs STT の料金です。

パラメーター型説明
audio_url or audio_asset_idstringソースです。ID には、オーディオのジョブか動画のジョブを指定できます。
languagestringen などの言語コードです。省略すると、自動で検出されます。
diarizeboolean各話者にラベルを付けます。デフォルトは false です。
tag_audio_eventsboolean[laughter] や [music] などの音に、印を付けます。デフォルトは false です。
word_timestampsboolean互換性のために残されています。単語のタイミングは、どちらの場合でも返されます。

戻り値:ジョブ ID です。文字起こしは、ジョブの出力に入ります。修正したテキストで動画に字幕を付けるには、json.words を単語ごとに 1 エントリーとして、add_captions の captions に対応付けます。Whisper エンジンは、キャンバスのノード、REST API、SDK、CLI で使えますが、このツールでは使えません。

audio_isolation

ミックスから BGM とノイズを取り除き、メインの声、ボーカル、楽器を 1 本のクリーンなトラックとして返します。音声抽出(Voice Extractor)ノードと同じように動作します。

権限:workflows:execute。クレジット:ElevenLabs Voice Isolation の料金で、長さによって決まります。

パラメーター型説明
audio_url or audio_asset_idstringソースです。ID には、オーディオのジョブか動画のジョブを指定できます。

戻り値:ジョブ ID です。

separate_audio

任意のオーディオを、ボーカルとインストゥルメンタル、またはドラム、ベース、ギター、ピアノ、その他のフルステムに分割します。Demucs で実行され、suno_separate_stems とは違って、Suno のトラックは不要です。音源分離(Audio Separation)ノードと同じように動作します。

権限:workflows:execute。クレジット:モードと品質によって、30〜80 です。

パラメーター型説明
audio_url or audio_asset_idstringソースです。audio_asset_id には、オーディオのジョブか、アップロードしたオーディオファイルを指定できます。動画は指定できません。
modestringvocal_instrumental(デフォルト)または stems です。
qualitystringauto(デフォルト)、fast、best のいずれかです。

戻り値:ジョブ ID です。vocalUrl、instrumentalUrl、drumsUrl など、各ステムの URL は get_job で読み取ります。

apply_audio_fx

声やクリップに、演出用のエフェクトをかけます。ドライな声を空間に置くリバーブや、電話、メガホン、エコーのエフェクトです。オーディオ FX(Audio FX)ノードと同じように動作します。

権限:workflows:execute。クレジット:20。

パラメーター型説明
audio_url or audio_asset_idstringソースです。ID には、オーディオのジョブか動画のジョブを指定できます。
presetstringroom(デフォルト)、bathroom、car、hall、concert-hall、church、cave、arena、outdoor、telephone、megaphone、echo、custom のいずれかです。
mixnumberリバーブの量で、0〜100 です。

戻り値:ジョブ ID です。

trim_audio

オーディオを、指定した時間範囲にトリミングします。動画のオーディオを抽出して、トリミングすることもできます。オーディオのトリミング(Trim Audio)ノードと同じように動作します。

権限:workflows:execute。クレジット:10。

パラメーター型説明
audio_url, audio_asset_id, video_url or video_asset_idstringソースを 1 つ指定します。動画のソースからは、そのオーディオトラックが得られます。
start_time, end_timenumber秒単位の時間範囲です。両方を省略すると、トラック全体が残ります。
audio_formatstringmp3(デフォルト)、wav、aac のいずれかです。

戻り値:ジョブ ID です。

download_youtube_audio

YouTube 動画のオーディオトラックを抽出します。

権限:workflows:execute。

パラメーター型説明
youtube_urlstring必須。YouTube 動画の URL です。

戻り値:ジョブ ID です。結果は、ほかのツールに渡せるオーディオファイルです。

よくある質問

最終更新

目次