# オーディオ

> Nodaro MCP のオーディオツールで、音声や会話の生成、ボイスのデザインと変更、吹き替え、効果音の作成、文字起こし、オーディオのクリーンアップやトリミングを行います。

Source: https://nodaro.ai/ja/docs/mcp/tools/audio

**オーディオツール**を使うと、アシスタントは Nodaro で音を作ったり変えたりできます。音声と会話、新しいボイスとボイスの変更、吹き替え、効果音、文字起こし、クリーンアップに対応しています。`list_voices` 以外の各ツールはジョブを開始してその ID を返し、結果はライブラリに保存されます。どのオーディオツールにも `workflows:execute` 権限が必要です。

| ツール | 機能 |
| --- | --- |
| [`generate_speech`](#generate_speech) | ボイスを指定したテキストの読み上げ |
| [`generate_dialogue`](#generate_dialogue) | 複数のボイスによる会話を 1 つのファイルに |
| [`list_voices`](#list_voices) | 標準ボイスの一覧 |
| [`voice_design`](#voice_design) | 説明から新しいボイスを作成 |
| [`voice_remix`](#voice_remix) | ボイス ID を使わず、説明したボイスで読み上げ |
| [`voice_changer`](#voice_changer) | 録音や動画の声を変更 |
| [`voice_changer_pro`](#voice_changer_pro) | 複数の話者の声を一度に変更 |
| [`dubbing`](#dubbing) | 声を保ったまま、音声を別の言語に翻訳 |
| [`text_to_audio`](#text_to_audio) | 説明から効果音を作成 |
| [`transcribe`](#transcribe) | 単語のタイミング付きで、音声をテキストに変換 |
| [`audio_isolation`](#audio_isolation) | ミックスからメインの声や音を分離 |
| [`separate_audio`](#separate_audio) | オーディオを、ボーカルとインストゥルメンタル、またはステムに分割 |
| [`apply_audio_fx`](#apply_audio_fx) | 声を空間に置くリバーブとエフェクト |
| [`trim_audio`](#trim_audio) | オーディオをトリミング、または動画から抽出 |
| [`download_youtube_audio`](#download_youtube_audio) | YouTube 動画のオーディオトラック |

## `generate_speech`
ElevenLabs のボイスで、テキストを音声に変換します。[**テキストから音声**（Text to Speech）](https://nodaro.ai/docs/nodes/audio/text-to-speech)ノードと同じように動作します。

**権限**：`workflows:execute`。**クレジット**：下記のモデルの料金です。

| Model | Maker | Modes | Credits | Details |
| --- | --- | --- | --- | --- |
| [ElevenLabs v3](https://nodaro.ai/docs/models/audio/elevenlabs-v3) | ElevenLabs | Text to speech | 30 | Latest ElevenLabs TTS — supports [audio tags] for emotion / pacing. Direct API. |
| [ElevenLabs Turbo v2.5](https://nodaro.ai/docs/models/audio/elevenlabs-turbo-v2-5) | ElevenLabs | Text to speech | 15 | Fast, cheap ElevenLabs TTS via the direct ElevenLabs API. Good for narration. |
| [ElevenLabs Multilingual v2](https://nodaro.ai/docs/models/audio/elevenlabs-multilingual-v2) | ElevenLabs | Text to speech | 30 | Multi-language ElevenLabs TTS via the direct ElevenLabs API. |

| パラメーター | 型 | 説明 |
| --- | --- | --- |
| `text` | string | **必須**。読み上げる内容で、最大 5,000 文字です。それより長い台本は、複数の呼び出しに分けます。 |
| `voice_id` | string | 標準ボイスの名前か、自分でクローンしたボイスの ID です。デフォルトは `Rachel` です。不明な ID を指定すると、`voice_not_found` で失敗します。 |
| `voice_type` | string | `premade`、`custom`、`library` のいずれかです。 |
| `model` | string | `elevenlabs-v3`（デフォルト）、`elevenlabs-turbo`、`elevenlabs-multilingual` のいずれかです。 |
| `language_code` | string | テキストの言語です。 |
| `stability`, `similarity_boost`, `style` | number | 話し方の設定で、0〜1 です。 |
| `speed` | number | 0.7〜1.2 です。 |
| `presetId` | string | [`list_node_presets`](https://nodaro.ai/docs/mcp/tools/models-and-credits#list_node_presets) で取得できる、話し方のプリセットです。たとえば**落ち着いたナレーター**（Calm Narrator）、**CM ナレーション**（Commercial Read）、**オーディオブック**（Audiobook）です。プリセットを使う場合も、`text` は指定します。 |

**モデルの選び方**：ElevenLabs v3 は、感情や間の取り方を指定する `[laughs]`、`[whispers]`、`[sighs]` などのオーディオタグに対応しています。また、完全な多言語対応なので、ヘブライ語、アラビア語、中国語、日本語、韓国語を含むすべての言語に使ってください。ElevenLabs Turbo は、シンプルなナレーションをより安く作れます。ElevenLabs Multilingual v2 は旧世代のモデルです。v2 でしか動かないことがわかっているボイスにだけ使ってください。

**ボイスの選び方**：標準ボイスは、Rachel、Aria、Roger、Sarah、Laura、Charlie、George、Callum、River、Liam、Charlotte です。さらに、Alice、Matilda、Will、Jessica、Eric、Chris、Brian、Daniel、Lily、Bill があります。温かみのある女性の声なら Rachel、若い女性の声なら Aria か Lily、深みのある男性の声なら Roger か Brian、ニュートラルな男性の声なら George か Daniel、イギリス英語の声なら Charlie か Charlotte を試してください。

**戻り値**：ジョブ ID です。音声の準備ができると、カードで再生されます。

## `generate_dialogue`
複数の話者による台本を、ElevenLabs Dialogue v3 で、自然な話者交代を含む 1 つのオーディオファイルとして読み上げます。会話、インタビュー、ポッドキャスト風のやり取り、シーンには、`generate_speech` のクリップを別々につなげる代わりに、このツールを使います。[**テキストから会話**（Text to Dialogue）](https://nodaro.ai/docs/nodes/audio/text-to-dialogue)ノードと同じように動作します。

**権限**：`workflows:execute`。**クレジット**：[ElevenLabs Dialogue v3](https://nodaro.ai/docs/models/audio/elevenlabs-dialogue-v3) の料金で、1,000 文字ごとに課金されます。

| パラメーター | 型 | 説明 |
| --- | --- | --- |
| `dialogue` | array | **必須**。話す順に並べたセリフで、1〜200 件です。各セリフは `{ text, voice_id }` です。同じキャラクターには同じボイスを使います。セリフには `[laughs]` などのオーディオタグを入れられます。 |
| `stability` | number | `0`（最も変化に富む）、`0.5`（バランス）、`1`（最も安定）のいずれかです。 |
| `language_code` | string | 言語のヒントです。たとえば `en` や `he` です。省略すると、言語が自動で検出されます。 |
| `seed` | integer | 再現できる結果にするための、固定のシードです。 |
| `apply_text_normalization` | string | 数字、日付、略語を、読み上げる形に展開します。`auto`（デフォルト）、`on`、`off` のいずれかです。 |

上限は、合計 5,000 文字と、1 回の呼び出しあたり 10 種類のボイスです。最高の品質を得るには、2,000 文字以下をおすすめします。同じ台本の中で、標準ボイスの名前とクローンしたボイスを混在させられます。

**戻り値**：ジョブ ID です。

## `list_voices`
標準ボイスを、ID、名前と、性別、アクセント、説明などの詳細（ある場合）とともに返します。`generate_speech`、`voice_changer`、`voice_changer_pro` には、ボイス ID が必要です。

**権限**：`workflows:execute`。**クレジット**：無料。

このツールにパラメーターはありません。カタログを読み取るだけで、ジョブは開始しません。

## `voice_design`
説明から新しいボイスをデザインし、そのボイスで台本を読み上げたサンプルを返します。ボイスを保存する前に、試聴するのに使います。[**ボイスデザイン**（Voice Design）](https://nodaro.ai/docs/nodes/audio/voice-design)ノードと同じように動作します。

**権限**：`workflows:execute`。**クレジット**：50。

| パラメーター | 型 | 説明 |
| --- | --- | --- |
| `voice_description` | string | **必須**。性別、年齢、アクセント、トーン、キャラクターなど、ボイスの説明で、最大 1,000 文字です。たとえば「warm female narrator with a soft British accent, low-pitched, calm pacing」です。 |
| `text` | string | **必須**。ボイスに読み上げさせるサンプルの台本で、100〜1,000 文字です。 |
| `model` | string | `eleven_ttv_v3`（デフォルト。すべての言語に対応）か、旧世代の `eleven_multilingual_ttv_v2` です。 |
| `loudness`, `guidance_scale`, `quality`, `seed`, `should_enhance` | | 任意のデザイン設定です。`loudness` は -1〜1、`guidance_scale` は 0〜100 です。 |

**戻り値**：ジョブ ID です。結果は、デザインしたボイスのオーディオサンプルです。

## `voice_remix`
言葉で説明したボイスで、ボイス ID を使わずにテキストを読み上げます。保存しておく必要のない、一度きりのボイスに使います。[**ボイスリミックス**（Voice Remix）](https://nodaro.ai/docs/nodes/audio/voice-remix)ノードと同じように動作します。

**権限**：`workflows:execute`。**クレジット**：40。

| パラメーター | 型 | 説明 |
| --- | --- | --- |
| `text` | string | **必須**。読み上げる内容で、最大 5,000 文字です。 |
| `voice_description` | string | **必須**。ボイスの説明で、最大 1,000 文字です。たとえば「a warm, mid-40s British woman with a calm news-anchor tone」です。 |

**戻り値**：ジョブ ID です。

## `voice_changer`
話し方とリズムを保ったまま、オーディオトラックや、話している動画全体の声を差し替えます。[**ボイスチェンジャー**（Voice Changer）](https://nodaro.ai/docs/nodes/audio/voice-changer)ノードと同じように動作します。

**権限**：`workflows:execute`。**クレジット**：40。

| パラメーター | 型 | 説明 |
| --- | --- | --- |
| `voice_id` | string | **必須**。新しいボイスです。標準ボイスの名前か、自分でクローンしたボイスの ID を指定します。 |
| `audio_url` or `audio_asset_id` | string | オーディオのソースです。 |
| `video_url` or `video_asset_id` | string | 代わりに使う、動画のソースです。両方を渡した場合は、動画が優先されます。 |
| `remove_background_noise` | boolean | `true` にすると、クリーンな声だけを返します。`false` にすると、音楽と効果音を新しい声の下に残します。 |
| `stability`, `similarity_boost`, `style` | number | 0〜1 です。`style` は、元の話し方を誇張します。0 より大きくすると処理が遅くなり、安定性が下がることがあります。 |

**戻り値**：ジョブ ID です。ソースが動画の場合、カードでは新しいオーディオをプレビューでき、新しい動画はライブラリに保存されます。

## `voice_changer_pro`
クリップ内のすべての話者を検出し、言葉とタイミングを保ったまま、それぞれに新しいボイスを割り当てます。最初に話した順に、話者 1 にはリストの 1 つ目のボイス、話者 2 には 2 つ目のボイス、というように割り当てられます。[**ボイスチェンジャー Pro**（Voice Changer Pro）](https://nodaro.ai/docs/nodes/audio/voice-changer-pro)ノードと同じように動作します。

**権限**：`workflows:execute`。**クレジット**：ボイスチェンジャー Pro ノードと同じです。**Nodaro Cloud のみ**。

| パラメーター | 型 | 説明 |
| --- | --- | --- |
| `ordered_voices` | array | **必須**。話者 1 人につき 1 つで、1〜8 件のエントリーです。各エントリーは、ボイス ID、独自の設定を持つオブジェクト、またはその話者の元の声を保つ `null` のいずれかです。少なくとも 1 件は、`null` 以外にする必要があります。 |
| `audio_url`, `audio_asset_id`, `video_url` or `video_asset_id` | string | ソースです。オーディオトラックか、声を差し替える動画を指定します。 |
| `analysis` | object | 以前の `voice_changer_pro_analyze` ジョブの出力です。これを渡すと、話者をもう一度検出するのではなく、ボイスを割り当てたときの話者リストをそのまま使って変更します。 |
| `preserve_background` | boolean | 音楽と効果音を、新しい声の下に再びミックスします。デフォルトは `true` です。 |
| `music_volume_mode`, `music_volume` | | 背景音の音量です。`match`（元の音量）、`normalize`、または 0〜200 の音量を指定する `manual` です。 |
| `voice_fx` | object | 背景音を戻す前に、新しい声にかけるリバーブやエフェクトです。`room`、`hall`、`church`、`telephone`、`echo` などの `preset` に、`wetDryMix`、`delayMs`、`decay` を組み合わせます。 |
| `separation_quality` | string | `fast`（デフォルト）または `best` です。 |
| `remove_background_noise` | boolean | 最初に背景ノイズを除去し、声だけのクリーンな結果にします。 |
| `output` | string | 完成した動画を返す `video`（デフォルト）か、`voice_changer_pro_export` で自分でミックスするための個別のトラックを返す `stems` です。 |
| `model` | string | ボイスモデルを上書きします。 |

ボイスのエントリーのオブジェクトは、`voiceId` と、任意の `engine`、`stability`、`similarityBoost`、`style`、`useSpeakerBoost`、`seed`、`volumeMode`、`volume` を受け付けます。`engine` は、元の演技の声を差し替える `sts`（デフォルト）か、ElevenLabs v3 で文字起こしからセリフを読み上げ直す `v3` です。`v3` エンジンは、オーディオタグと、0、0.5、1 のいずれかの安定性を受け付けます。文字起こしは `analysis` から読み取り、分析がない場合は独自に文字起こしを行います。

**戻り値**：ジョブ ID です。

## `voice_changer_pro_analyze`
クリップ内の話者を、変更せずに検出します。インタラクティブな流れの最初のステップです。ジョブの出力には、分離された声と背景音のトラック、各話者とその時間区間、最初の登場位置、単語数、テキストの抜粋、そして言語が含まれます。出力を確認して、各話者のボイスを選んだり、拍手など、人ではない「話者」を見つけたりします。

**権限**：`workflows:execute`。**Nodaro Cloud のみ**。

| パラメーター | 型 | 説明 |
| --- | --- | --- |
| `audio_url`, `audio_asset_id`, `video_url` or `video_asset_id` | string | ソースのクリップです。 |
| `separation_quality` | string | `fast`（デフォルト）または `best` です。 |
| `suggest_title` | boolean | 文字起こしからタイトルも提案し、`suggestedTitle` として返します。 |

**戻り値**：ジョブ ID です。その `output_data` を、`analysis` として `voice_changer_pro` に渡します。

## `voice_changer_pro_export`
自分で作ったトラックのミックスから、完成した動画をレンダリングします。`output: "stems"` を指定した `voice_changer_pro` の後に行う、インタラクティブな流れの最後のステップです。映像は再エンコードされずにコピーされます。

**権限**：`workflows:execute`。**Nodaro Cloud のみ**。

| パラメーター | 型 | 説明 |
| --- | --- | --- |
| `tracks` | array | **必須**。1〜16 本のトラックです。各トラックには、`url`、0〜200 の `gain`（100 で変化なし）、`muted`、`kind` を指定します。`kind` は `voice`（デフォルト）か `background` です。少なくとも 1 本は、ミュートされていないトラックが必要です。 |
| `video_url` or `video_asset_id` | string | ソースの動画です。 |
| `voice_fx` | object | ボイスのトラックにだけかけるエフェクトです。 |

**戻り値**：ジョブ ID です。

## `dubbing`
各話者の声とタイミングを保ったまま、音声を別の言語に翻訳します。ソースが動画の場合は、吹き替えた動画とそのオーディオトラックが返されます。[**吹き替え**（Dubbing）](https://nodaro.ai/docs/nodes/audio/dubbing)ノードと同じように動作します。

**権限**：`workflows:execute`。**クレジット**：吹き替える区間の 1 分ごとに課金されます。

| パラメーター | 型 | 説明 |
| --- | --- | --- |
| `target_language` | string | **必須**。言語コードです。たとえば `en`、`es`、`fr`、`de`、`ja`、`zh`、`ko`、`ar` です。 |
| `audio_url`, `audio_asset_id`, `video_url`, `video_asset_id` or `source_url` | string | **ソースは 1 つだけ指定します**。`source_url` には、公開されている YouTube や TikTok のリンク、またはファイルへの直接リンクを指定します。リンク先は直接取得されます。 |
| `source_language` | string | ソースの言語のヒントです。省略すると、自動で検出されます。 |
| `num_speakers` | integer | 異なる声の数で、最大 20 です。`0` にすると、自動で検出します。 |
| `disable_voice_cloning` | boolean | 各話者自身の声ではなく、似た声のネイティブのボイスを使います。 |
| `drop_background_audio` | boolean | 背景音を取り除きます。音声だけのソースに使います。 |
| `start_time`, `end_time` | number | ソースの一部だけを吹き替えます。単位は秒です。 |
| `highest_resolution` | boolean | 動画のソースの解像度を保ちます。処理は遅くなります。 |
| `use_profanity_filter`, `target_accent`, `watermark` | | 任意です。`target_accent` は、声を特定のアクセントに近づけます。 |

1 回の吹き替えで扱えるのは、最大 30 分です。それより長いソースの一部を吹き替えるには、`start_time` と `end_time` を使います。

**戻り値**：ジョブ ID です。

## `text_to_audio`
説明から効果音を作ります。フォーリー、環境音、インターフェースの効果音などです。音声や音楽には使いません。[**テキストからオーディオ**（Text to Audio）](https://nodaro.ai/docs/nodes/audio/text-to-audio)ノードと同じように動作します。

**権限**：`workflows:execute`。**クレジット**：[ElevenLabs Sound Effects](https://nodaro.ai/docs/models/audio/elevenlabs-sound-effects) の料金です。

| パラメーター | 型 | 説明 |
| --- | --- | --- |
| `prompt` | string | 音の説明で、最大 2,000 文字です。たとえば「thunderstorm with heavy rain」です。プリセットが指定する場合を除き、必須です。 |
| `duration` | number | 0.5〜30 秒です。デフォルトでは、モデルが長さを決めます。 |
| `loop` | boolean | 音が途切れずにループするようにします。 |
| `prompt_influence` | number | 音がプロンプトにどれだけ忠実に従うかで、0〜1 です。 |
| `presetId` | string | プリセットです。たとえば**雨の環境音**（Rain Ambience）、**風切り音のトランジション**（Whoosh Transition）、**インパクト／ドーン**（Impact / Boom）です。 |

**戻り値**：ジョブ ID です。

## `transcribe`
ElevenLabs STT エンジンで、オーディオファイルや動画ファイルの音声をテキストに変換します。単語のタイミングはミリ秒単位で、常に `output_data.json.words` に入ります。[**文字起こし**（Transcribe）](https://nodaro.ai/docs/nodes/audio/transcribe)ノードと同じように動作します。

**権限**：`workflows:execute`。**クレジット**：[ElevenLabs STT](https://nodaro.ai/docs/models/audio/elevenlabs-stt) の料金です。

| パラメーター | 型 | 説明 |
| --- | --- | --- |
| `audio_url` or `audio_asset_id` | string | ソースです。ID には、オーディオのジョブか動画のジョブを指定できます。 |
| `language` | string | `en` などの言語コードです。省略すると、自動で検出されます。 |
| `diarize` | boolean | 各話者にラベルを付けます。デフォルトは `false` です。 |
| `tag_audio_events` | boolean | `[laughter]` や `[music]` などの音に、印を付けます。デフォルトは `false` です。 |
| `word_timestamps` | boolean | 互換性のために残されています。単語のタイミングは、どちらの場合でも返されます。 |

**戻り値**：ジョブ ID です。文字起こしは、ジョブの出力に入ります。修正したテキストで動画に字幕を付けるには、`json.words` を単語ごとに 1 エントリーとして、[`add_captions`](https://nodaro.ai/docs/mcp/tools/video-editing#add_captions) の `captions` に対応付けます。Whisper エンジンは、キャンバスのノード、REST API、SDK、CLI で使えますが、このツールでは使えません。

## `audio_isolation`
ミックスから BGM とノイズを取り除き、メインの声、ボーカル、楽器を 1 本のクリーンなトラックとして返します。[**音声抽出**（Voice Extractor）](https://nodaro.ai/docs/nodes/audio/voice-extractor)ノードと同じように動作します。

**権限**：`workflows:execute`。**クレジット**：[ElevenLabs Voice Isolation](https://nodaro.ai/docs/models/audio/elevenlabs-voice-isolation) の料金で、長さによって決まります。

| パラメーター | 型 | 説明 |
| --- | --- | --- |
| `audio_url` or `audio_asset_id` | string | ソースです。ID には、オーディオのジョブか動画のジョブを指定できます。 |

**戻り値**：ジョブ ID です。

## `separate_audio`
任意のオーディオを、ボーカルとインストゥルメンタル、またはドラム、ベース、ギター、ピアノ、その他のフルステムに分割します。Demucs で実行され、`suno_separate_stems` とは違って、Suno のトラックは不要です。[**音源分離**（Audio Separation）](https://nodaro.ai/docs/nodes/audio/audio-separation)ノードと同じように動作します。

**権限**：`workflows:execute`。**クレジット**：モードと品質によって、30〜80 です。

| パラメーター | 型 | 説明 |
| --- | --- | --- |
| `audio_url` or `audio_asset_id` | string | ソースです。`audio_asset_id` には、オーディオのジョブか、アップロードしたオーディオファイルを指定できます。動画は指定できません。 |
| `mode` | string | `vocal_instrumental`（デフォルト）または `stems` です。 |
| `quality` | string | `auto`（デフォルト）、`fast`、`best` のいずれかです。 |

**戻り値**：ジョブ ID です。`vocalUrl`、`instrumentalUrl`、`drumsUrl` など、各ステムの URL は `get_job` で読み取ります。

## `apply_audio_fx`
声やクリップに、演出用のエフェクトをかけます。ドライな声を空間に置くリバーブや、電話、メガホン、エコーのエフェクトです。[**オーディオ FX**（Audio FX）](https://nodaro.ai/docs/nodes/audio/audio-fx)ノードと同じように動作します。

**権限**：`workflows:execute`。**クレジット**：20。

| パラメーター | 型 | 説明 |
| --- | --- | --- |
| `audio_url` or `audio_asset_id` | string | ソースです。ID には、オーディオのジョブか動画のジョブを指定できます。 |
| `preset` | string | `room`（デフォルト）、`bathroom`、`car`、`hall`、`concert-hall`、`church`、`cave`、`arena`、`outdoor`、`telephone`、`megaphone`、`echo`、`custom` のいずれかです。 |
| `mix` | number | リバーブの量で、0〜100 です。 |

**戻り値**：ジョブ ID です。

## `trim_audio`
オーディオを、指定した時間範囲にトリミングします。動画のオーディオを抽出して、トリミングすることもできます。[**オーディオのトリミング**（Trim Audio）](https://nodaro.ai/docs/nodes/audio/trim-audio)ノードと同じように動作します。

**権限**：`workflows:execute`。**クレジット**：10。

| パラメーター | 型 | 説明 |
| --- | --- | --- |
| `audio_url`, `audio_asset_id`, `video_url` or `video_asset_id` | string | ソースを 1 つ指定します。動画のソースからは、そのオーディオトラックが得られます。 |
| `start_time`, `end_time` | number | 秒単位の時間範囲です。両方を省略すると、トラック全体が残ります。 |
| `audio_format` | string | `mp3`（デフォルト）、`wav`、`aac` のいずれかです。 |

**戻り値**：ジョブ ID です。

## `download_youtube_audio`
YouTube 動画のオーディオトラックを抽出します。

**権限**：`workflows:execute`。

| パラメーター | 型 | 説明 |
| --- | --- | --- |
| `youtube_url` | string | **必須**。YouTube 動画の URL です。 |

**戻り値**：ジョブ ID です。結果は、ほかのツールに渡せるオーディオファイルです。

## Frequently asked questions

### generate_speech のデフォルトのボイスは何ですか？

ElevenLabs v3 モデルの Rachel です。voice_id には、Aria、Roger、Charlotte などの標準ボイスの名前か、自分でクローンしたボイスの ID を指定します。標準ボイスの一覧は list_voices で取得できます。

### 2 つのボイスで会話を作るにはどうすればよいですか？

generate_dialogue に、テキストとボイスを指定したセリフのリストを、話す順に渡します。自然な話者交代を含む 1 つのオーディオファイルが返されます。別々の音声クリップをつなげるよりも、自然に聞こえます。

### ElevenLabs v3 は英語以外の言語も話せますか？

はい。ヘブライ語、アラビア語、中国語、日本語、韓国語を含む完全な多言語対応なので、どの言語にも使ってください。[laughs] や [whispers] などのオーディオタグも理解します。

### 字幕用の単語のタイミングを取得するにはどうすればよいですか？

transcribe を呼び出します。単語のタイミングはミリ秒単位で、常にジョブの output_data.json.words に入ります。これは、add_captions が captions として受け付ける形です。

### 1 つのクリップで、複数の声を変更できますか？

はい。Nodaro Cloud で voice_changer_pro を使います。各話者を検出し、最初に話した順に、リストで指定したボイスをそれぞれに割り当てます。言葉とタイミングはそのまま保たれます。
